AI-modell topplister

Flerkilde AI-rangeringer for chat, tale, TTS, ASR, kode, bilde, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModellLeverandørElo ?Stemmer ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Kilde: arena.ai · Oppdatert Aug 21, 2026 · PandaNpc Oppdatert 29. aug. 2026, 06:00 UTCSe full ledertavle →

Hvordan lese tall

arena.ai (tidligere LMArena) viser brukerne to anonyme svar på samme spørsmål og ber dem velge ett, og utleder deretter en Elo-rating fra disse kampene. Den måler hvilket svar folk foretrekker – ikke objektiv evne. En sympatisk stil kan vinne, mens et grundig, men ordrikt svar kan tape.

Stemmer er kampene en modell har akkumulert. En nylig oppført modell har få stemmer og et bredt konfidensintervall, så rangeringen svinger lett — les alltid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer annerledes enn resten: den måler reelle agentøkter i stedet for blinde stemmepreferanser. Hovedmålet, Net Improvement, er en prosentvis gevinst – ikke en Elo-rating – så det kan ikke sammenlignes på tvers av tavler. arena.ai rapporterer også fem flere dimensjoner (Confirmed Success, Steerability, Bash Recovery og andre) på hele ledertavlen.

Brukertavlen kommer fra OpenRouter og teller reell API token-andel — utviklere som stemmer med lommeboken, noe som utfyller de subjektive preferansetavlene.

Taletavlene kommer fra Artificial Analysis: TTS bruker Speech Arena Elo fra blindlytting; ASR bruker AA-WER v2, der lavere er bedre; og nativ Speech-to-Speech bruker en likevektet sammensetning av Big Bench Audio, Full Duplex Bench og τ-Voice, der høyere er bedre. Sammenlign kun skårer innenfor samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index på 0-100, som måler objektiv kapasitet fremfor subjektiv preferanse — et naturlig supplement til arena.ais blinde avstemning. Kilde: artificialanalysis.ai.