AI-modelltopplistor

Flerkälliga AI-rankningar för chatt, tal, TTS, ASR, kod, bild, video och agenter — från arena.ai, OpenRouter och Artificial Analysis.

RankModellLeverantörElo ?Röster ?Input ?OutputCache ?
1Anthropicclaude-opus-5-highAnthropic1520 ±151,6635.0025.00.500
2Anthropicclaude-opus-4-6Anthropic1510 ±637,2715.0025.00.500
3Anthropicclaude-opus-4-6-highAnthropic1506 ±724,9735.0025.00.500
4Anthropicclaude-fable-5Anthropic1504 ±95,79210.050.01.00
5Anthropicclaude-opus-4-7Anthropic1498 ±718,9905.0025.00.500
6Anthropicclaude-opus-4-7-highAnthropic1497 ±718,7935.0025.00.500
7OpenAIgpt-5.5-highOpenAI1485 ±716,8165.0030.00.500
8Anthropicclaude-sonnet-4-6Anthropic1483 ±654,4273.0015.00.300
9OpenAIgpt-5.5OpenAI1480 ±717,2865.0030.00.500
10OpenAIgpt-5.6-terra-xhighOpenAI1479 ±131,9692.0012.00.200
11OpenAIgpt-5.6-sol-xhighOpenAI1479 ±171,1522.0010.00.200
12Anthropicclaude-opus-4-8-highAnthropic1475 ±88,3885.0025.00.500
13Metamuse-spark-1.1Meta1472 ±132,0541.254.250.150
14Anthropicclaude-sonnet-5-highAnthropic1470 ±103,6012.0010.00.200
15OpenAIgpt-5.4OpenAI1470 ±729,8092.5015.00.250

Källa: arena.ai · Uppdaterad Jul 26, 2026 · PandaNpc Uppdaterad 29 aug. 2026 06:00 UTCVisa hela topplistan →

Läsa dessa siffror

arena.ai (tidigare LMArena) visar användarna två anonyma svar på samma prompt och ber dem välja ett, och härleder sedan ett Elo-betyg från dessa matcher. Det mäter vilket svar folk föredrar — inte objektiv förmåga. En tilltalande stil kan vinna, medan ett noggrant men omständligt svar kan förlora.

Röster är de strider en modell har samlat på sig. En nyligen listad modell har få röster och ett brett konfidensintervall, så dess rankning svänger lätt — läs alltid rankningen tillsammans med ±-intervallet.

Agent-tavlan fungerar annorlunda än de andra: den mäter verkliga agentsessioner istället för blindröstpreferens. Dess huvudmått, Net Improvement, är en procentuell ökning — inte ett Elo-betyg — så det kan inte jämföras över tavlor. arena.ai rapporterar även ytterligare fem dimensioner (Confirmed Success, Steerability, Bash Recovery och andra) på den fullständiga ledartavlan.

Användningstavlan kommer från OpenRouter och räknar verklig API-tokenandel — utvecklare som röstar med sina plånböcker, vilket kompletterar de subjektiva preferenstavlorna.

Taltavlorna kommer från Artificial Analysis: TTS använder blindlyssnad Speech Arena Elo; ASR använder AA-WER v2, där lägre är bättre; och inbyggd Speech-to-Speech använder en likaviktad sammansättning av Big Bench Audio, Full Duplex Bench och τ-Voice, där högre är bättre. Jämför poäng endast inom samma tavla. Källa: artificialanalysis.ai.

Intelligence Index-tavlan kommer från Artificial Analysis: den destillerar många offentliga riktmärken till ett enda Intelligence Index från 0 till 100, som mäter objektiv förmåga snarare än subjektiv preferens — ett naturligt komplement till arena.ais mänskliga blindomröstning. Källa: artificialanalysis.ai.