Rankingi modeli AI
Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.
| Miejsce | Model | Dostawca | Elo ? | Głosy ? |
|---|---|---|---|---|
| 1 | gemini-omni-flash | 1512 ±11 | 16,916 | |
| 2 | flux-3-video | Black Forest Labs | 1494 ±17 | 1,291 |
| 3 | dreamina-seedance-2.0-720p | Bytedance | 1482 ±10 | 49,058 |
| 4 | dreamina-seedance-2.5-720p | Bytedance | 1477 ±19 | 1,337 |
| 5 | muse-video | Meta | 1457 ±15 | 2,176 |
| 6 | minimax-h3 | MiniMax | 1453 ±13 | 3,081 |
| 7 | happyhorse-1.0 | Alibaba-ATH | 1428 ±13 | 22,113 |
| 8 | sora-2-pro | OpenAI | 1364 ±7 | 46,509 |
| 9 | veo-3.1-audio | 1364 ±14 | 13,743 | |
| 10 | veo-3.1-audio-1080p | 1363 ±10 | 24,979 | |
| 11 | veo-3.1-fast-audio | 1361 ±10 | 39,441 | |
| 12 | veo-3.1-fast-audio-1080p | 1358 ±10 | 25,771 | |
| 13 | veo-3-fast-audio | 1347 ±11 | 25,219 | |
| 14 | grok-imagine-video-720p | SpaceXAI | 1345 ±7 | 154,827 |
| 15 | wan2.7-t2v | Alibaba | 1344 ±9 | 17,769 |
Źródło: arena.ai · Aktualizacja Aug 14, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →
Jak czytać te liczby
arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.
Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.
Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.
Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.
Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.
Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.
