AI-mallien sijoituslistat

Monilähteiset AI-sijoitukset chatille, puheelle, TTS:lle, ASR:lle, koodille, kuvalle, videolle ja agenteille — arena.ai:sta, OpenRouterista ja Artificial Analysisista.

SijaMalliToimittajaElo ?Äänet ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Lähde: arena.ai · Päivitetty Aug 25, 2026 · PandaNpc Päivitetty 29.8.2026 klo 06.00 UTCNäytä koko sijoituslista →

Numeroiden lukeminen

arena.ai (entinen LMArena) näyttää käyttäjille kaksi anonymisoitua vastausta samaan kehotteeseen ja pyytää heitä valitsemaan yhden, sitten se laskee Elo-arvosanan näiden taistelujen perusteella. Se mittaa, kumpaa vastausta ihmiset suosivat – ei objektiivista kyvykkyyttä. Miellyttävä tyyli voi voittaa, kun taas perusteellinen mutta pitkäveteinen vastaus voi hävitä.

Äänet ovat taisteluita, joita malli on kerännyt. Vasta listatulla mallilla on vähän ääniä ja leveä luottamusväli, joten sen sijoitus heilahtelee helposti — lue aina sijoitus yhdessä ±-välin kanssa.

Agentti-paneeli toimii eri tavalla kuin muut: se mittaa oikeita agenttisessioita eikä sokeita äänestysmieltymyksiä. Sen päätunnusluku, Net Improvement, on prosentuaalinen nousu — ei Elo-luokitus — joten sitä ei voi verrata paneelien välillä. arena.ai raportoi myös viisi muuta ulottuvuutta (Confirmed Success, Steerability, Bash Recovery ja muita) koko johtotaululla.

Käyttötaulu tulee OpenRouterista ja laskee todellista API-token-osuutta — kehittäjien äänestäessä lompakoillaan, mikä täydentää subjektiivisia mieltymystauluja.

Puhelistat ovat peräisin Artificial Analysis -palvelusta: TTS käyttää sokkokuunteluun perustuvaa Speech Arena Elo -pisteistöä; ASR käyttää AA-WER v2:ta, jossa pienempi arvo on parempi; ja natiivi Speech-to-Speech käyttää Big Bench Audio-, Full Duplex Bench- ja τ-Voice-arvioinneista koostuvaa yhtä painotettua yhdistelmää, jossa suurempi arvo on parempi. Vertaa pisteitä vain saman listan sisällä. Lähde: artificialanalysis.ai.

Intelligence Index -listaus on peräisin Artificial Analysisilta: se tiivistää monet julkiset vertailuarvot yhdeksi 0–100 Intelligence Indexiksi, mitaten objektiivista kyvykkyyttä subjektiivisen mieltymyksen sijaan — luonnollinen täydennys arena.ai:n ihmisten sokealle äänestykselle. Lähde: artificialanalysis.ai.