Rankingi modeli AI

Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.

MiejsceModelDostawcaElo ?Głosy ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1508 ±524,33110.050.01.00
2Anthropicclaude-opus-4-6-highAnthropic1504 ±472,3595.0025.00.500
3Anthropicclaude-opus-4-7-highAnthropic1502 ±460,2035.0025.00.500
4Metamuse-spark-1.2 (xHigh)Meta1498 ±103,2571.254.250.150
5Anthropicclaude-opus-4-6Anthropic1497 ±376,3625.0025.00.500
6Anthropicclaude-opus-4-7Anthropic1494 ±461,3045.0025.00.500
7Anthropicclaude-opus-5-highAnthropic1493 ±527,6105.0025.00.500
8Metamuse-spark-1.1Meta1491 ±520,2421.254.250.150
9Googlegemini-3.7-flash-highGoogle1490 ±85,7180.7503.750.075
10Moonshotkimi-k3-maxMoonshot1489 ±615,0543.0015.00.300
11Metamuse-sparkMeta1488 ±613,584
12Anthropicclaude-opus-5-maxAnthropic1487 ±613,4035.0025.00.500
13Z.aiglm-5.3-maxZ.ai1487 ±103,7511.404.400.260
14Googlegemini-3.1-pro-previewGoogle1486 ±399,1822.0012.00.200
15Googlegemini-3-proGoogle1485 ±441,491

Źródło: arena.ai · Aktualizacja Aug 21, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →

Jak czytać te liczby

arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.

Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.

Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.

Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.

Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.

Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.