AI-modelltopplistor

Flerkälliga AI-rankningar för chatt, tal, TTS, ASR, kod, bild, video och agenter — från arena.ai, OpenRouter och Artificial Analysis.

RankModellLeverantörElo ?Röster ?
1MiniMaxminimax-h3MiniMax1489 ±713,020
2Bytedancedreamina-seedance-2.5-720pBytedance1484 ±122,912
3Bytedancedreamina-seedance-2.0-720pBytedance1478 ±8105,298
4Googlegemini-omni-flashGoogle1462 ±654,179
5SpaceXAIgrok-imagine-video-1.5-720pSpaceXAI1460 ±599,649
6Black Forest Labsflux-3-video-20260811Black Forest Labs1449 ±103,770
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1442 ±1070,772
8Alibabawan2.7-i2vAlibaba1427 ±557,878
9SpaceXAIgrok-imagine-video-720pSpaceXAI1415 ±5517,108
10Googleveo-3.1-audioGoogle1397 ±1125,156
11Googleveo-3.1-audio-1080pGoogle1390 ±953,179
12Googleveo-3.1-fast-audioGoogle1384 ±999,932
13SpaceXAIgrok-imagine-video-480pSpaceXAI1384 ±819,443
14Googleveo-3.1-fast-audio-1080pGoogle1371 ±1054,455
15Shengshuvidu-q3-proShengshu1362 ±936,723

Källa: arena.ai · Uppdaterad Aug 14, 2026 · PandaNpc Uppdaterad 29 aug. 2026 06:00 UTCVisa hela topplistan →

Läsa dessa siffror

arena.ai (tidigare LMArena) visar användarna två anonyma svar på samma prompt och ber dem välja ett, och härleder sedan ett Elo-betyg från dessa matcher. Det mäter vilket svar folk föredrar — inte objektiv förmåga. En tilltalande stil kan vinna, medan ett noggrant men omständligt svar kan förlora.

Röster är de strider en modell har samlat på sig. En nyligen listad modell har få röster och ett brett konfidensintervall, så dess rankning svänger lätt — läs alltid rankningen tillsammans med ±-intervallet.

Agent-tavlan fungerar annorlunda än de andra: den mäter verkliga agentsessioner istället för blindröstpreferens. Dess huvudmått, Net Improvement, är en procentuell ökning — inte ett Elo-betyg — så det kan inte jämföras över tavlor. arena.ai rapporterar även ytterligare fem dimensioner (Confirmed Success, Steerability, Bash Recovery och andra) på den fullständiga ledartavlan.

Användningstavlan kommer från OpenRouter och räknar verklig API-tokenandel — utvecklare som röstar med sina plånböcker, vilket kompletterar de subjektiva preferenstavlorna.

Taltavlorna kommer från Artificial Analysis: TTS använder blindlyssnad Speech Arena Elo; ASR använder AA-WER v2, där lägre är bättre; och inbyggd Speech-to-Speech använder en likaviktad sammansättning av Big Bench Audio, Full Duplex Bench och τ-Voice, där högre är bättre. Jämför poäng endast inom samma tavla. Källa: artificialanalysis.ai.

Intelligence Index-tavlan kommer från Artificial Analysis: den destillerar många offentliga riktmärken till ett enda Intelligence Index från 0 till 100, som mäter objektiv förmåga snarare än subjektiv preferens — ett naturligt komplement till arena.ais mänskliga blindomröstning. Källa: artificialanalysis.ai.