AI Model Ranglister

AI-rangeringer fra flere kilder til chat, tale, TTS, ASR, kode, billede, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModelLeverandørAndel % ?Tokens ?Input ?OutputCache ?
1OpenAIgpt-5.6-luna-20260709OpenAI11.9%1.7T0.2001.200.020
2DeepSeekdeepseek-v4-flash-20260731DeepSeek11.3%1.6T0.0300.1000.0070
3Xiaomimimo-v2.5-20260422Xiaomi11.1%1.6T0.1400.2800.0028
4Zhipuglm-5.3-flash-20260826Zhipu10.9%1.6T0.0750.2500.015
5Tencenthy3-20260706Tencent6.8%963.0B0.1320.5280.033
6Nvidianemotron-3-ultra-550b-a55b-20260604Nvidia5.3%750.2B0.5002.200.100
7DeepSeekdeepseek-v4-flash-20260423DeepSeek5%711.5B0.0300.1000.0070
8MiniMaxminimax-m3-20260531MiniMax4.2%605.1B0.3001.200.060
9Tencenthy4-preview-20260827Tencent2.6%363.8B0.8342.500.042
10Googlegemini-3.7-flash-20260813Google2.5%353.6B0.7503.750.075
11Zhipuglm-5.2-20260616Zhipu2.4%338.1B1.193.740.221
12OpenAIgpt-5.6-sol-20260709OpenAI1.7%248.2B2.0010.00.200
13DeepSeekdeepseek-v4-pro-20260423DeepSeek1.6%233.3B0.6601.980.022
14Moonshotkimi-k3-20260715Moonshot1.6%226.0B3.0015.00.300
15Anthropicclaude-opus-5-20260723Anthropic1.5%220.7B5.0025.00.500

Kilde: OpenRouter · Opdateret 2026-08-28 · PandaNpc Opdateret 29. aug. 2026, 06.00 UTCSe hele ranglisten →

Sådan læses disse tal

arena.ai (tidligere LMArena) viser brugere to anonyme svar på samme prompt og beder dem vælge ét, og udleder derefter en Elo-rating fra disse kampe. Det måler, hvilket svar folk foretrækker — ikke objektiv evne. En sympatisk stil kan vinde, mens et grundigt men ordrigt svar kan tabe.

Stemmer er de kampe, en model har akkumuleret. En nyligt tilføjet model har få stemmer og et bredt konfidensinterval, så dens rangering svinger let — læs altid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer anderledes end resten: den måler rigtige agentsessioner i stedet for blindafstemningspræference. Dens hovedmetrik, Net Improvement, er en procentvis stigning – ikke en Elo-rating – så den kan ikke sammenlignes på tværs af tavler. arena.ai rapporterer også fem yderligere dimensioner (Confirmed Success, Steerability, Bash Recovery og andre) på det fulde leaderboard.

Brugstavlen kommer fra OpenRouter og tæller reelle API-token-andele — udviklere stemmer med deres tegnebøger, hvilket supplerer de subjektive præferencetavler.

Tale-tavlerne stammer fra Artificial Analysis: TTS bruger blindlyttet Speech Arena Elo; ASR bruger AA-WER v2, hvor lavere er bedre; og native Speech-to-Speech bruger en ligevægtet sammensætning af Big Bench Audio, Full Duplex Bench og τ-Voice, hvor højere er bedre. Sammenlign kun scorer inden for samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index fra 0-100, der måler objektiv kapacitet snarere end subjektiv præference — et naturligt supplement til arena.ai's menneskelige blinde afstemning. Kilde: artificialanalysis.ai.