AI-mallien sijoituslistat

Monilähteiset AI-sijoitukset chatille, puheelle, TTS:lle, ASR:lle, koodille, kuvalle, videolle ja agenteille — arena.ai:sta, OpenRouterista ja Artificial Analysisista.

SijaMalliToimittajaElo ?Äänet ?
1Googlegemini-omni-flashGoogle1512 ±1116,916
2Black Forest Labsflux-3-videoBlack Forest Labs1494 ±171,291
3Bytedancedreamina-seedance-2.0-720pBytedance1482 ±1049,058
4Bytedancedreamina-seedance-2.5-720pBytedance1477 ±191,337
5Metamuse-videoMeta1457 ±152,176
6MiniMaxminimax-h3MiniMax1453 ±133,081
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1428 ±1322,113
8OpenAIsora-2-proOpenAI1364 ±746,509
9Googleveo-3.1-audioGoogle1364 ±1413,743
10Googleveo-3.1-audio-1080pGoogle1363 ±1024,979
11Googleveo-3.1-fast-audioGoogle1361 ±1039,441
12Googleveo-3.1-fast-audio-1080pGoogle1358 ±1025,771
13Googleveo-3-fast-audioGoogle1347 ±1125,219
14SpaceXAIgrok-imagine-video-720pSpaceXAI1345 ±7154,827
15Alibabawan2.7-t2vAlibaba1344 ±917,769

Lähde: arena.ai · Päivitetty Aug 14, 2026 · PandaNpc Päivitetty 29.8.2026 klo 06.00 UTCNäytä koko sijoituslista →

Numeroiden lukeminen

arena.ai (entinen LMArena) näyttää käyttäjille kaksi anonymisoitua vastausta samaan kehotteeseen ja pyytää heitä valitsemaan yhden, sitten se laskee Elo-arvosanan näiden taistelujen perusteella. Se mittaa, kumpaa vastausta ihmiset suosivat – ei objektiivista kyvykkyyttä. Miellyttävä tyyli voi voittaa, kun taas perusteellinen mutta pitkäveteinen vastaus voi hävitä.

Äänet ovat taisteluita, joita malli on kerännyt. Vasta listatulla mallilla on vähän ääniä ja leveä luottamusväli, joten sen sijoitus heilahtelee helposti — lue aina sijoitus yhdessä ±-välin kanssa.

Agentti-paneeli toimii eri tavalla kuin muut: se mittaa oikeita agenttisessioita eikä sokeita äänestysmieltymyksiä. Sen päätunnusluku, Net Improvement, on prosentuaalinen nousu — ei Elo-luokitus — joten sitä ei voi verrata paneelien välillä. arena.ai raportoi myös viisi muuta ulottuvuutta (Confirmed Success, Steerability, Bash Recovery ja muita) koko johtotaululla.

Käyttötaulu tulee OpenRouterista ja laskee todellista API-token-osuutta — kehittäjien äänestäessä lompakoillaan, mikä täydentää subjektiivisia mieltymystauluja.

Puhelistat ovat peräisin Artificial Analysis -palvelusta: TTS käyttää sokkokuunteluun perustuvaa Speech Arena Elo -pisteistöä; ASR käyttää AA-WER v2:ta, jossa pienempi arvo on parempi; ja natiivi Speech-to-Speech käyttää Big Bench Audio-, Full Duplex Bench- ja τ-Voice-arvioinneista koostuvaa yhtä painotettua yhdistelmää, jossa suurempi arvo on parempi. Vertaa pisteitä vain saman listan sisällä. Lähde: artificialanalysis.ai.

Intelligence Index -listaus on peräisin Artificial Analysisilta: se tiivistää monet julkiset vertailuarvot yhdeksi 0–100 Intelligence Indexiksi, mitaten objektiivista kyvykkyyttä subjektiivisen mieltymyksen sijaan — luonnollinen täydennys arena.ai:n ihmisten sokealle äänestykselle. Lähde: artificialanalysis.ai.