AI-modell topplister

Flerkilde AI-rangeringer for chat, tale, TTS, ASR, kode, bilde, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModellLeverandørElo ?Stemmer ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Kilde: arena.ai · Oppdatert Aug 25, 2026 · PandaNpc Oppdatert 29. aug. 2026, 06:00 UTCSe full ledertavle →

Hvordan lese tall

arena.ai (tidligere LMArena) viser brukerne to anonyme svar på samme spørsmål og ber dem velge ett, og utleder deretter en Elo-rating fra disse kampene. Den måler hvilket svar folk foretrekker – ikke objektiv evne. En sympatisk stil kan vinne, mens et grundig, men ordrikt svar kan tape.

Stemmer er kampene en modell har akkumulert. En nylig oppført modell har få stemmer og et bredt konfidensintervall, så rangeringen svinger lett — les alltid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer annerledes enn resten: den måler reelle agentøkter i stedet for blinde stemmepreferanser. Hovedmålet, Net Improvement, er en prosentvis gevinst – ikke en Elo-rating – så det kan ikke sammenlignes på tvers av tavler. arena.ai rapporterer også fem flere dimensjoner (Confirmed Success, Steerability, Bash Recovery og andre) på hele ledertavlen.

Brukertavlen kommer fra OpenRouter og teller reell API token-andel — utviklere som stemmer med lommeboken, noe som utfyller de subjektive preferansetavlene.

Taletavlene kommer fra Artificial Analysis: TTS bruker Speech Arena Elo fra blindlytting; ASR bruker AA-WER v2, der lavere er bedre; og nativ Speech-to-Speech bruker en likevektet sammensetning av Big Bench Audio, Full Duplex Bench og τ-Voice, der høyere er bedre. Sammenlign kun skårer innenfor samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index på 0-100, som måler objektiv kapasitet fremfor subjektiv preferanse — et naturlig supplement til arena.ais blinde avstemning. Kilde: artificialanalysis.ai.