AI-modell topplister

Flerkilde AI-rangeringer for chat, tale, TTS, ASR, kode, bilde, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModellLeverandørElo ?Stemmer ?
1MiniMaxminimax-h3MiniMax1489 ±713,020
2Bytedancedreamina-seedance-2.5-720pBytedance1484 ±122,912
3Bytedancedreamina-seedance-2.0-720pBytedance1478 ±8105,298
4Googlegemini-omni-flashGoogle1462 ±654,179
5SpaceXAIgrok-imagine-video-1.5-720pSpaceXAI1460 ±599,649
6Black Forest Labsflux-3-video-20260811Black Forest Labs1449 ±103,770
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1442 ±1070,772
8Alibabawan2.7-i2vAlibaba1427 ±557,878
9SpaceXAIgrok-imagine-video-720pSpaceXAI1415 ±5517,108
10Googleveo-3.1-audioGoogle1397 ±1125,156
11Googleveo-3.1-audio-1080pGoogle1390 ±953,179
12Googleveo-3.1-fast-audioGoogle1384 ±999,932
13SpaceXAIgrok-imagine-video-480pSpaceXAI1384 ±819,443
14Googleveo-3.1-fast-audio-1080pGoogle1371 ±1054,455
15Shengshuvidu-q3-proShengshu1362 ±936,723

Kilde: arena.ai · Oppdatert Aug 14, 2026 · PandaNpc Oppdatert 29. aug. 2026, 06:00 UTCSe full ledertavle →

Hvordan lese tall

arena.ai (tidligere LMArena) viser brukerne to anonyme svar på samme spørsmål og ber dem velge ett, og utleder deretter en Elo-rating fra disse kampene. Den måler hvilket svar folk foretrekker – ikke objektiv evne. En sympatisk stil kan vinne, mens et grundig, men ordrikt svar kan tape.

Stemmer er kampene en modell har akkumulert. En nylig oppført modell har få stemmer og et bredt konfidensintervall, så rangeringen svinger lett — les alltid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer annerledes enn resten: den måler reelle agentøkter i stedet for blinde stemmepreferanser. Hovedmålet, Net Improvement, er en prosentvis gevinst – ikke en Elo-rating – så det kan ikke sammenlignes på tvers av tavler. arena.ai rapporterer også fem flere dimensjoner (Confirmed Success, Steerability, Bash Recovery og andre) på hele ledertavlen.

Brukertavlen kommer fra OpenRouter og teller reell API token-andel — utviklere som stemmer med lommeboken, noe som utfyller de subjektive preferansetavlene.

Taletavlene kommer fra Artificial Analysis: TTS bruker Speech Arena Elo fra blindlytting; ASR bruker AA-WER v2, der lavere er bedre; og nativ Speech-to-Speech bruker en likevektet sammensetning av Big Bench Audio, Full Duplex Bench og τ-Voice, der høyere er bedre. Sammenlign kun skårer innenfor samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index på 0-100, som måler objektiv kapasitet fremfor subjektiv preferanse — et naturlig supplement til arena.ais blinde avstemning. Kilde: artificialanalysis.ai.