Rankingi modeli AI

Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.

MiejsceModelDostawcaPoprawa netto ?Sesje ?Input ?OutputCache ?
1AnthropicClaude Opus 5 (High)Anthropic12.73% ±1.6320,0705.0025.00.500
2AnthropicClaude Opus 5 (Max)Anthropic12.41% ±1.9115,8505.0025.00.500
3AnthropicClaude Fable 5 (High)Anthropic11.62% ±1.6332,98110.050.01.00
4OpenAIGPT 5.6 Sol (xHigh)OpenAI10.31% ±1.4526,9602.0010.00.200
5AnthropicClaude Opus 4.8 (High)Anthropic9.99% ±1.5335,5885.0025.00.500
6MoonshotKimi K3 (Max)Moonshot9.53% ±0.6189,7583.0015.00.300
7OpenAIGPT 5.5 (xHigh)OpenAI8.56% ±0.9748,5495.0030.00.500
8AnthropicClaude Sonnet 5 (High)Anthropic8.05% ±2.2726,1082.0010.00.200
9AnthropicClaude Opus 4.7 (High)Anthropic7.27% ±1.2636,5635.0025.00.500
10AnthropicClaude Opus 4.7Anthropic7.18% ±1.2837,0995.0025.00.500

Źródło: arena.ai · Aktualizacja Aug 24, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →

Jak czytać te liczby

arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.

Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.

Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.

Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.

Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.

Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.