AI Model Ranglister

AI-rangeringer fra flere kilder til chat, tale, TTS, ASR, kode, billede, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModelLeverandørElo ?Stemmer ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1382 ±475,014
2Microsoft AImai-image-2.6-previewMicrosoft AI1331 ±86,418
3SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1316 ±122,675
4Revereve-2.1Reve1302 ±87,580
5Metamuse-imageMeta1281 ±622,691
6Revereve-2.0Reve1270 ±614,631
7Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1263 ±536,3920.5003.00
8Bytedanceseedream-5.0-proBytedance1258 ±548,174
9Alibabaqwen-image-3.0-proAlibaba1255 ±710,927
10Microsoft AImai-image-2.5Microsoft AI1254 ±456,737
11Googlegemini-3.1-flash-lite-image (nano-banana-2-lite)Google1251 ±616,3810.2501.50
12Googlegemini-3-pro-image-2k (nano-banana-pro)Google1245 ±3146,806
13OpenAIgpt-image-1.5-high-fidelityOpenAI1239 ±3148,079
14Googlegemini-3-pro-image-preview (nano-banana-pro)Google1232 ±582,7382.0012.00.200
15Ideogramideogram-4.0-qualityIdeogram1204 ±536,647

Kilde: arena.ai · Opdateret Aug 25, 2026 · PandaNpc Opdateret 29. aug. 2026, 06.00 UTCSe hele ranglisten →

Sådan læses disse tal

arena.ai (tidligere LMArena) viser brugere to anonyme svar på samme prompt og beder dem vælge ét, og udleder derefter en Elo-rating fra disse kampe. Det måler, hvilket svar folk foretrækker — ikke objektiv evne. En sympatisk stil kan vinde, mens et grundigt men ordrigt svar kan tabe.

Stemmer er de kampe, en model har akkumuleret. En nyligt tilføjet model har få stemmer og et bredt konfidensinterval, så dens rangering svinger let — læs altid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer anderledes end resten: den måler rigtige agentsessioner i stedet for blindafstemningspræference. Dens hovedmetrik, Net Improvement, er en procentvis stigning – ikke en Elo-rating – så den kan ikke sammenlignes på tværs af tavler. arena.ai rapporterer også fem yderligere dimensioner (Confirmed Success, Steerability, Bash Recovery og andre) på det fulde leaderboard.

Brugstavlen kommer fra OpenRouter og tæller reelle API-token-andele — udviklere stemmer med deres tegnebøger, hvilket supplerer de subjektive præferencetavler.

Tale-tavlerne stammer fra Artificial Analysis: TTS bruger blindlyttet Speech Arena Elo; ASR bruger AA-WER v2, hvor lavere er bedre; og native Speech-to-Speech bruger en ligevægtet sammensætning af Big Bench Audio, Full Duplex Bench og τ-Voice, hvor højere er bedre. Sammenlign kun scorer inden for samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index fra 0-100, der måler objektiv kapacitet snarere end subjektiv præference — et naturligt supplement til arena.ai's menneskelige blinde afstemning. Kilde: artificialanalysis.ai.