AI-modell topplister

Flerkilde AI-rangeringer for chat, tale, TTS, ASR, kode, bilde, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.

RangModellLeverandørIntelligensindeks ?Input ?OutputCache ?
1AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic63.15.0025.00.500
2AnthropicClaude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic62.55.0025.00.500
3AnthropicClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.110.050.01.00
4AnthropicClaude Opus 5 (Adaptive Reasoning, High Effort)Anthropic61.55.0025.00.500
5OpenAIGPT-5.6 Sol (max)OpenAI60.92.0010.00.200
6SpaceXAIGrok 4.6 (high)SpaceXAI60.92.006.000.500
7SpaceXAIGrok 4.6 (xhigh)SpaceXAI602.006.000.500
8KimiKimi K3 (max)Kimi59.73.0015.00.300
9Z AIGLM-5.3 (max)Z AI59.51.404.400.260
10OpenAIGPT-5.6 Sol (xhigh)OpenAI592.0010.00.200
11SpaceXAIGrok 4.6 (medium)SpaceXAI592.006.000.500
12AnthropicClaude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic58.65.0025.00.500
13AlibabaQwen3.8 MaxAlibaba58.12.006.000.250
14AlibabaQwen3.8 2.4T A95BAlibaba57.72.006.000.250
15Z AIGLM-5.3-FlashZ AI57.50.0750.2500.015

Kilde: Artificial Analysis · Oppdatert Aug 29, 2026 · PandaNpc Oppdatert 29. aug. 2026, 06:00 UTCSe full ledertavle →

Hvordan lese tall

arena.ai (tidligere LMArena) viser brukerne to anonyme svar på samme spørsmål og ber dem velge ett, og utleder deretter en Elo-rating fra disse kampene. Den måler hvilket svar folk foretrekker – ikke objektiv evne. En sympatisk stil kan vinne, mens et grundig, men ordrikt svar kan tape.

Stemmer er kampene en modell har akkumulert. En nylig oppført modell har få stemmer og et bredt konfidensintervall, så rangeringen svinger lett — les alltid rangeringen sammen med ±-intervallet.

Agent-tavlen fungerer annerledes enn resten: den måler reelle agentøkter i stedet for blinde stemmepreferanser. Hovedmålet, Net Improvement, er en prosentvis gevinst – ikke en Elo-rating – så det kan ikke sammenlignes på tvers av tavler. arena.ai rapporterer også fem flere dimensjoner (Confirmed Success, Steerability, Bash Recovery og andre) på hele ledertavlen.

Brukertavlen kommer fra OpenRouter og teller reell API token-andel — utviklere som stemmer med lommeboken, noe som utfyller de subjektive preferansetavlene.

Taletavlene kommer fra Artificial Analysis: TTS bruker Speech Arena Elo fra blindlytting; ASR bruker AA-WER v2, der lavere er bedre; og nativ Speech-to-Speech bruker en likevektet sammensetning av Big Bench Audio, Full Duplex Bench og τ-Voice, der høyere er bedre. Sammenlign kun skårer innenfor samme tavle. Kilde: artificialanalysis.ai.

Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index på 0-100, som måler objektiv kapasitet fremfor subjektiv preferanse — et naturlig supplement til arena.ais blinde avstemning. Kilde: artificialanalysis.ai.