Rankingi modeli AI

Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.

MiejsceModelDostawcaElo ?Głosy ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1312 ±99,56210.050.01.00
2Alibabaqwen3.8-maxAlibaba1302 ±86,7432.006.000.250
3Anthropicclaude-opus-4-7-highAnthropic1301 ±721,1225.0025.00.500
4Anthropicclaude-opus-4-7Anthropic1299 ±721,4455.0025.00.500
5Anthropicclaude-opus-4-6-highAnthropic1299 ±720,8675.0025.00.500
6Metamuse-sparkMeta1294 ±95,582
7Anthropicclaude-opus-4-6Anthropic1293 ±725,1695.0025.00.500
8Metamuse-spark-1.2 (xHigh)Meta1292 ±151,8531.254.250.150
9Anthropicclaude-opus-5-highAnthropic1292 ±97,0495.0025.00.500
10Googlegemini-3-proGoogle1289 ±813,134
11Googlegemini-3.5-flash-highGoogle1286 ±97,5861.509.000.150
12Anthropicclaude-opus-4-8-highAnthropic1285 ±812,8945.0025.00.500
13Googlegemini-3.6-flash-highGoogle1285 ±123,1190.7503.750.075
14OpenAIgpt-5.5OpenAI1285 ±720,7275.0030.00.500
15Googlegemini-3.5-flash-mediumGoogle1285 ±97,5331.509.000.150

Źródło: arena.ai · Aktualizacja Aug 21, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →

Jak czytać te liczby

arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.

Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.

Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.

Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.

Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.

Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.