AI-mallien sijoituslistat

Monilähteiset AI-sijoitukset chatille, puheelle, TTS:lle, ASR:lle, koodille, kuvalle, videolle ja agenteille — arena.ai:sta, OpenRouterista ja Artificial Analysisista.

SijaMalliToimittajaNettoparannus ?istunnot ?Input ?OutputCache ?
1AnthropicClaude Opus 5 (High)Anthropic12.73% ±1.6320,0705.0025.00.500
2AnthropicClaude Opus 5 (Max)Anthropic12.41% ±1.9115,8505.0025.00.500
3AnthropicClaude Fable 5 (High)Anthropic11.62% ±1.6332,98110.050.01.00
4OpenAIGPT 5.6 Sol (xHigh)OpenAI10.31% ±1.4526,9602.0010.00.200
5AnthropicClaude Opus 4.8 (High)Anthropic9.99% ±1.5335,5885.0025.00.500
6MoonshotKimi K3 (Max)Moonshot9.53% ±0.6189,7583.0015.00.300
7OpenAIGPT 5.5 (xHigh)OpenAI8.56% ±0.9748,5495.0030.00.500
8AnthropicClaude Sonnet 5 (High)Anthropic8.05% ±2.2726,1082.0010.00.200
9AnthropicClaude Opus 4.7 (High)Anthropic7.27% ±1.2636,5635.0025.00.500
10AnthropicClaude Opus 4.7Anthropic7.18% ±1.2837,0995.0025.00.500

Lähde: arena.ai · Päivitetty Aug 24, 2026 · PandaNpc Päivitetty 29.8.2026 klo 06.00 UTCNäytä koko sijoituslista →

Numeroiden lukeminen

arena.ai (entinen LMArena) näyttää käyttäjille kaksi anonymisoitua vastausta samaan kehotteeseen ja pyytää heitä valitsemaan yhden, sitten se laskee Elo-arvosanan näiden taistelujen perusteella. Se mittaa, kumpaa vastausta ihmiset suosivat – ei objektiivista kyvykkyyttä. Miellyttävä tyyli voi voittaa, kun taas perusteellinen mutta pitkäveteinen vastaus voi hävitä.

Äänet ovat taisteluita, joita malli on kerännyt. Vasta listatulla mallilla on vähän ääniä ja leveä luottamusväli, joten sen sijoitus heilahtelee helposti — lue aina sijoitus yhdessä ±-välin kanssa.

Agentti-paneeli toimii eri tavalla kuin muut: se mittaa oikeita agenttisessioita eikä sokeita äänestysmieltymyksiä. Sen päätunnusluku, Net Improvement, on prosentuaalinen nousu — ei Elo-luokitus — joten sitä ei voi verrata paneelien välillä. arena.ai raportoi myös viisi muuta ulottuvuutta (Confirmed Success, Steerability, Bash Recovery ja muita) koko johtotaululla.

Käyttötaulu tulee OpenRouterista ja laskee todellista API-token-osuutta — kehittäjien äänestäessä lompakoillaan, mikä täydentää subjektiivisia mieltymystauluja.

Puhelistat ovat peräisin Artificial Analysis -palvelusta: TTS käyttää sokkokuunteluun perustuvaa Speech Arena Elo -pisteistöä; ASR käyttää AA-WER v2:ta, jossa pienempi arvo on parempi; ja natiivi Speech-to-Speech käyttää Big Bench Audio-, Full Duplex Bench- ja τ-Voice-arvioinneista koostuvaa yhtä painotettua yhdistelmää, jossa suurempi arvo on parempi. Vertaa pisteitä vain saman listan sisällä. Lähde: artificialanalysis.ai.

Intelligence Index -listaus on peräisin Artificial Analysisilta: se tiivistää monet julkiset vertailuarvot yhdeksi 0–100 Intelligence Indexiksi, mitaten objektiivista kyvykkyyttä subjektiivisen mieltymyksen sijaan — luonnollinen täydennys arena.ai:n ihmisten sokealle äänestykselle. Lähde: artificialanalysis.ai.