Rankingi modeli AI
Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.
| Miejsce | Model | Dostawca | Indeks Mowy ? |
|---|---|---|---|
| 1 | Qwen Audio 3.0 Realtime Plus | Alibaba | 84% |
| 2 | Grok Voice Think Fast 2.0 High | SpaceXAI | 82.7% |
| 3 | GPT-Realtime-2.1 High | OpenAI | 79.3% |
| 4 | GPT-Realtime-2 High | OpenAI | 77.3% |
| 5 | Qwen Audio 3.0 Realtime Flash | Alibaba | 76.3% |
| 6 | Grok Voice Think Fast 1.0 | SpaceXAI | 75.7% |
| 7 | GPT-Realtime-2 Medium | OpenAI | 75% |
| 8 | GPT-Realtime-2.1 Minimal | OpenAI | 72.7% |
| 9 | GPT-Realtime-1.5 | OpenAI | 72% |
| 10 | GPT Realtime (Aug 2025) | OpenAI | 69% |
| 11 | GPT-Realtime-2 Minimal | OpenAI | 66.3% |
| 12 | GPT-Realtime-2.1 Mini High | OpenAI | 65.3% |
| 13 | Grok Voice Agent | SpaceXAI | 64% |
| 14 | Deepslate Opal | Deepslate | 63% |
| 15 | Higgs Realtime | Boson AI | 60.3% |
Źródło: Artificial Analysis · Aktualizacja Aug 29, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →
Jak czytać te liczby
arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.
Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.
Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.
Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.
Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.
Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.
