AI Model Ranglister

AI-rangeringer fra flere kilder til chat, tale, TTS, ASR, kode, billede, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModelLeverandørElo ?Stemmer ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Kilde: arena.ai · Opdateret Aug 25, 2026 · PandaNpc Opdateret 29. aug. 2026, 06.00 UTCSe hele ranglisten →

Sådan læses disse tal

arena.ai (tidligere LMArena) viser brugere to anonyme svar på samme prompt og beder dem vælge ét, og udleder derefter en Elo-rating fra disse kampe. Det måler, hvilket svar folk foretrækker — ikke objektiv evne. En sympatisk stil kan vinde, mens et grundigt men ordrigt svar kan tabe.

Stemmer er de kampe, en model har akkumuleret. En nyligt tilføjet model har få stemmer og et bredt konfidensinterval, så dens rangering svinger let — læs altid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer anderledes end resten: den måler rigtige agentsessioner i stedet for blindafstemningspræference. Dens hovedmetrik, Net Improvement, er en procentvis stigning – ikke en Elo-rating – så den kan ikke sammenlignes på tværs af tavler. arena.ai rapporterer også fem yderligere dimensioner (Confirmed Success, Steerability, Bash Recovery og andre) på det fulde leaderboard.

Brugstavlen kommer fra OpenRouter og tæller reelle API-token-andele — udviklere stemmer med deres tegnebøger, hvilket supplerer de subjektive præferencetavler.

Tale-tavlerne stammer fra Artificial Analysis: TTS bruger blindlyttet Speech Arena Elo; ASR bruger AA-WER v2, hvor lavere er bedre; og native Speech-to-Speech bruger en ligevægtet sammensætning af Big Bench Audio, Full Duplex Bench og τ-Voice, hvor højere er bedre. Sammenlign kun scorer inden for samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index fra 0-100, der måler objektiv kapacitet snarere end subjektiv præference — et naturligt supplement til arena.ai's menneskelige blinde afstemning. Kilde: artificialanalysis.ai.