AI-modell topplister

Flerkilde AI-rangeringer for chat, tale, TTS, ASR, kode, bilde, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModellLeverandørElo ?Stemmer ?
1Googlegemini-omni-flashGoogle1512 ±1116,916
2Black Forest Labsflux-3-videoBlack Forest Labs1494 ±171,291
3Bytedancedreamina-seedance-2.0-720pBytedance1482 ±1049,058
4Bytedancedreamina-seedance-2.5-720pBytedance1477 ±191,337
5Metamuse-videoMeta1457 ±152,176
6MiniMaxminimax-h3MiniMax1453 ±133,081
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1428 ±1322,113
8OpenAIsora-2-proOpenAI1364 ±746,509
9Googleveo-3.1-audioGoogle1364 ±1413,743
10Googleveo-3.1-audio-1080pGoogle1363 ±1024,979
11Googleveo-3.1-fast-audioGoogle1361 ±1039,441
12Googleveo-3.1-fast-audio-1080pGoogle1358 ±1025,771
13Googleveo-3-fast-audioGoogle1347 ±1125,219
14SpaceXAIgrok-imagine-video-720pSpaceXAI1345 ±7154,827
15Alibabawan2.7-t2vAlibaba1344 ±917,769

Kilde: arena.ai · Oppdatert Aug 14, 2026 · PandaNpc Oppdatert 29. aug. 2026, 06:00 UTCSe full ledertavle →

Hvordan lese tall

arena.ai (tidligere LMArena) viser brukerne to anonyme svar på samme spørsmål og ber dem velge ett, og utleder deretter en Elo-rating fra disse kampene. Den måler hvilket svar folk foretrekker – ikke objektiv evne. En sympatisk stil kan vinne, mens et grundig, men ordrikt svar kan tape.

Stemmer er kampene en modell har akkumulert. En nylig oppført modell har få stemmer og et bredt konfidensintervall, så rangeringen svinger lett — les alltid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer annerledes enn resten: den måler reelle agentøkter i stedet for blinde stemmepreferanser. Hovedmålet, Net Improvement, er en prosentvis gevinst – ikke en Elo-rating – så det kan ikke sammenlignes på tvers av tavler. arena.ai rapporterer også fem flere dimensjoner (Confirmed Success, Steerability, Bash Recovery og andre) på hele ledertavlen.

Brukertavlen kommer fra OpenRouter og teller reell API token-andel — utviklere som stemmer med lommeboken, noe som utfyller de subjektive preferansetavlene.

Taletavlene kommer fra Artificial Analysis: TTS bruker Speech Arena Elo fra blindlytting; ASR bruker AA-WER v2, der lavere er bedre; og nativ Speech-to-Speech bruker en likevektet sammensetning av Big Bench Audio, Full Duplex Bench og τ-Voice, der høyere er bedre. Sammenlign kun skårer innenfor samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index på 0-100, som måler objektiv kapasitet fremfor subjektiv preferanse — et naturlig supplement til arena.ais blinde avstemning. Kilde: artificialanalysis.ai.