AI-modelltopplistor

Flerkälliga AI-rankningar för chatt, tal, TTS, ASR, kod, bild, video och agenter — från arena.ai, OpenRouter och Artificial Analysis.

RankModellLeverantörElo ?Röster ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Källa: arena.ai · Uppdaterad Aug 21, 2026 · PandaNpc Uppdaterad 29 aug. 2026 06:00 UTCVisa hela topplistan →

Läsa dessa siffror

arena.ai (tidigare LMArena) visar användarna två anonyma svar på samma prompt och ber dem välja ett, och härleder sedan ett Elo-betyg från dessa matcher. Det mäter vilket svar folk föredrar — inte objektiv förmåga. En tilltalande stil kan vinna, medan ett noggrant men omständligt svar kan förlora.

Röster är de strider en modell har samlat på sig. En nyligen listad modell har få röster och ett brett konfidensintervall, så dess rankning svänger lätt — läs alltid rankningen tillsammans med ±-intervallet.

Agent-tavlan fungerar annorlunda än de andra: den mäter verkliga agentsessioner istället för blindröstpreferens. Dess huvudmått, Net Improvement, är en procentuell ökning — inte ett Elo-betyg — så det kan inte jämföras över tavlor. arena.ai rapporterar även ytterligare fem dimensioner (Confirmed Success, Steerability, Bash Recovery och andra) på den fullständiga ledartavlan.

Användningstavlan kommer från OpenRouter och räknar verklig API-tokenandel — utvecklare som röstar med sina plånböcker, vilket kompletterar de subjektiva preferenstavlorna.

Taltavlorna kommer från Artificial Analysis: TTS använder blindlyssnad Speech Arena Elo; ASR använder AA-WER v2, där lägre är bättre; och inbyggd Speech-to-Speech använder en likaviktad sammansättning av Big Bench Audio, Full Duplex Bench och τ-Voice, där högre är bättre. Jämför poäng endast inom samma tavla. Källa: artificialanalysis.ai.

Intelligence Index-tavlan kommer från Artificial Analysis: den destillerar många offentliga riktmärken till ett enda Intelligence Index från 0 till 100, som mäter objektiv förmåga snarare än subjektiv preferens — ett naturligt komplement till arena.ais mänskliga blindomröstning. Källa: artificialanalysis.ai.