AI-mallien sijoituslistat

Monilähteiset AI-sijoitukset chatille, puheelle, TTS:lle, ASR:lle, koodille, kuvalle, videolle ja agenteille — arena.ai:sta, OpenRouterista ja Artificial Analysisista.

SijaMalliToimittajaElo ?Äänet ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Lähde: arena.ai · Päivitetty Aug 21, 2026 · PandaNpc Päivitetty 29.8.2026 klo 06.00 UTCNäytä koko sijoituslista →

Numeroiden lukeminen

arena.ai (entinen LMArena) näyttää käyttäjille kaksi anonymisoitua vastausta samaan kehotteeseen ja pyytää heitä valitsemaan yhden, sitten se laskee Elo-arvosanan näiden taistelujen perusteella. Se mittaa, kumpaa vastausta ihmiset suosivat – ei objektiivista kyvykkyyttä. Miellyttävä tyyli voi voittaa, kun taas perusteellinen mutta pitkäveteinen vastaus voi hävitä.

Äänet ovat taisteluita, joita malli on kerännyt. Vasta listatulla mallilla on vähän ääniä ja leveä luottamusväli, joten sen sijoitus heilahtelee helposti — lue aina sijoitus yhdessä ±-välin kanssa.

Agentti-paneeli toimii eri tavalla kuin muut: se mittaa oikeita agenttisessioita eikä sokeita äänestysmieltymyksiä. Sen päätunnusluku, Net Improvement, on prosentuaalinen nousu — ei Elo-luokitus — joten sitä ei voi verrata paneelien välillä. arena.ai raportoi myös viisi muuta ulottuvuutta (Confirmed Success, Steerability, Bash Recovery ja muita) koko johtotaululla.

Käyttötaulu tulee OpenRouterista ja laskee todellista API-token-osuutta — kehittäjien äänestäessä lompakoillaan, mikä täydentää subjektiivisia mieltymystauluja.

Puhelistat ovat peräisin Artificial Analysis -palvelusta: TTS käyttää sokkokuunteluun perustuvaa Speech Arena Elo -pisteistöä; ASR käyttää AA-WER v2:ta, jossa pienempi arvo on parempi; ja natiivi Speech-to-Speech käyttää Big Bench Audio-, Full Duplex Bench- ja τ-Voice-arvioinneista koostuvaa yhtä painotettua yhdistelmää, jossa suurempi arvo on parempi. Vertaa pisteitä vain saman listan sisällä. Lähde: artificialanalysis.ai.

Intelligence Index -listaus on peräisin Artificial Analysisilta: se tiivistää monet julkiset vertailuarvot yhdeksi 0–100 Intelligence Indexiksi, mitaten objektiivista kyvykkyyttä subjektiivisen mieltymyksen sijaan — luonnollinen täydennys arena.ai:n ihmisten sokealle äänestykselle. Lähde: artificialanalysis.ai.