AI Model Ranglister

AI-rangeringer fra flere kilder til chat, tale, TTS, ASR, kode, billede, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModelLeverandørElo ?Stemmer ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1312 ±99,56210.050.01.00
2Alibabaqwen3.8-maxAlibaba1302 ±86,7432.006.000.250
3Anthropicclaude-opus-4-7-highAnthropic1301 ±721,1225.0025.00.500
4Anthropicclaude-opus-4-7Anthropic1299 ±721,4455.0025.00.500
5Anthropicclaude-opus-4-6-highAnthropic1299 ±720,8675.0025.00.500
6Metamuse-sparkMeta1294 ±95,582
7Anthropicclaude-opus-4-6Anthropic1293 ±725,1695.0025.00.500
8Metamuse-spark-1.2 (xHigh)Meta1292 ±151,8531.254.250.150
9Anthropicclaude-opus-5-highAnthropic1292 ±97,0495.0025.00.500
10Googlegemini-3-proGoogle1289 ±813,134
11Googlegemini-3.5-flash-highGoogle1286 ±97,5861.509.000.150
12Anthropicclaude-opus-4-8-highAnthropic1285 ±812,8945.0025.00.500
13Googlegemini-3.6-flash-highGoogle1285 ±123,1190.7503.750.075
14OpenAIgpt-5.5OpenAI1285 ±720,7275.0030.00.500
15Googlegemini-3.5-flash-mediumGoogle1285 ±97,5331.509.000.150

Kilde: arena.ai · Opdateret Aug 21, 2026 · PandaNpc Opdateret 29. aug. 2026, 06.00 UTCSe hele ranglisten →

Sådan læses disse tal

arena.ai (tidligere LMArena) viser brugere to anonyme svar på samme prompt og beder dem vælge ét, og udleder derefter en Elo-rating fra disse kampe. Det måler, hvilket svar folk foretrækker — ikke objektiv evne. En sympatisk stil kan vinde, mens et grundigt men ordrigt svar kan tabe.

Stemmer er de kampe, en model har akkumuleret. En nyligt tilføjet model har få stemmer og et bredt konfidensinterval, så dens rangering svinger let — læs altid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer anderledes end resten: den måler rigtige agentsessioner i stedet for blindafstemningspræference. Dens hovedmetrik, Net Improvement, er en procentvis stigning – ikke en Elo-rating – så den kan ikke sammenlignes på tværs af tavler. arena.ai rapporterer også fem yderligere dimensioner (Confirmed Success, Steerability, Bash Recovery og andre) på det fulde leaderboard.

Brugstavlen kommer fra OpenRouter og tæller reelle API-token-andele — udviklere stemmer med deres tegnebøger, hvilket supplerer de subjektive præferencetavler.

Tale-tavlerne stammer fra Artificial Analysis: TTS bruger blindlyttet Speech Arena Elo; ASR bruger AA-WER v2, hvor lavere er bedre; og native Speech-to-Speech bruger en ligevægtet sammensætning af Big Bench Audio, Full Duplex Bench og τ-Voice, hvor højere er bedre. Sammenlign kun scorer inden for samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index fra 0-100, der måler objektiv kapacitet snarere end subjektiv præference — et naturligt supplement til arena.ai's menneskelige blinde afstemning. Kilde: artificialanalysis.ai.