Rankingi modeli AI
Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.
| Miejsce | Model | Dostawca | Elo ? | Głosy ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-image-2 (medium) | OpenAI | 1462 ±4 | 212,326 | — | — | — |
| 2 | grok-imagine-image-2.0 (low) | SpaceXAI | 1439 ±8 | 5,936 | — | — | — |
| 3 | mai-image-2.6-preview | Microsoft AI | 1417 ±7 | 9,013 | — | — | — |
| 4 | muse-image | Meta | 1405 ±5 | 66,921 | — | — | — |
| 5 | mai-image-2.5 | Microsoft AI | 1399 ±4 | 173,251 | — | — | — |
| 6 | seedream-5.0-pro | Bytedance | 1395 ±4 | 129,749 | — | — | — |
| 7 | gemini-3-pro-image-2k (nano-banana-pro) | 1390 ±3 | 530,645 | — | — | — | |
| 8 | grok-imagine-image-quality (20260519) | SpaceXAI | 1390 ±6 | 35,596 | — | — | — |
| 9 | chatgpt-image-latest-high-fidelity (20251216) | OpenAI | 1390 ±3 | 520,974 | — | — | — |
| 10 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1387 ±4 | 132,009 | 0.500 | 3.00 | — | |
| 11 | gemini-3-pro-image-preview (nano-banana-pro) | 1385 ±3 | 518,482 | 2.00 | 12.0 | 0.200 | |
| 12 | reve-2.1 | Reve | 1375 ±6 | 19,103 | — | — | — |
| 13 | gpt-image-1.5-high-fidelity | OpenAI | 1371 ±3 | 543,542 | — | — | — |
| 14 | reve-2.0 | Reve | 1358 ±7 | 17,502 | — | — | — |
| 15 | uni-1.1-max | Luma AI | 1333 ±5 | 40,908 | — | — | — |
Źródło: arena.ai · Aktualizacja Aug 25, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →
Jak czytać te liczby
arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.
Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.
Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.
Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.
Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.
Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.
