AI Model Ranglijsten

AI-ranglijsten van meerdere bronnen voor chat, spraak, TTS, ASR, code, beeld, video en agents — van arena.ai, OpenRouter en Artificial Analysis.

RangModelLeverancierIntelligentie-index ?Input ?OutputCache ?
1AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic63.15.0025.00.500
2AnthropicClaude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic62.55.0025.00.500
3AnthropicClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.110.050.01.00
4AnthropicClaude Opus 5 (Adaptive Reasoning, High Effort)Anthropic61.55.0025.00.500
5OpenAIGPT-5.6 Sol (max)OpenAI60.92.0010.00.200
6SpaceXAIGrok 4.6 (high)SpaceXAI60.92.006.000.500
7SpaceXAIGrok 4.6 (xhigh)SpaceXAI602.006.000.500
8KimiKimi K3 (max)Kimi59.73.0015.00.300
9Z AIGLM-5.3 (max)Z AI59.51.404.400.260
10OpenAIGPT-5.6 Sol (xhigh)OpenAI592.0010.00.200
11SpaceXAIGrok 4.6 (medium)SpaceXAI592.006.000.500
12AnthropicClaude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic58.65.0025.00.500
13AlibabaQwen3.8 MaxAlibaba58.12.006.000.250
14AlibabaQwen3.8 2.4T A95BAlibaba57.72.006.000.250
15Z AIGLM-5.3-FlashZ AI57.50.0750.2500.015

Bron: Artificial Analysis · Bijgewerkt Aug 29, 2026 · PandaNpc Bijgewerkt 29 aug 2026, 06:00 UTCBekijk volledige ranglijst →

Hoe getallen lezen

arena.ai (voorheen LMArena) toont gebruikers twee anonieme antwoorden op dezelfde prompt en vraagt hen er één te kiezen, waarna het een Elo-rating afleidt uit die gevechten. Het meet welk antwoord mensen prefereren — niet objectieve capaciteit. Een sympathieke stijl kan winnen, terwijl een grondig maar breedsprakig antwoord kan verliezen.

Stemmen zijn de gevechten die een model heeft verzameld. Een nieuw vermeld model heeft weinig stemmen en een groot betrouwbaarheidsinterval, dus de rangorde schommelt gemakkelijk — lees de rang altijd samen met het ±-interval.

Het Agent-bord werkt anders dan de rest: het meet echte agentsessies in plaats van blinde stemvoorkeuren. De hoofdmetriek, Net Improvement, is een procentuele stijging — geen Elo-rating — dus het kan niet worden vergeleken tussen borden. arena.ai rapporteert ook vijf extra dimensies (Confirmed Success, Steerability, Bash Recovery en andere) op het volledige leaderboard.

Het gebruiksbord komt van OpenRouter en telt het daadwerkelijke API-tokenaandeel — ontwikkelaars stemmen met hun portemonnee, wat een aanvulling is op de subjectieve voorkeursborden.

De spraak-leaderboards komen van Artificial Analysis: TTS gebruikt Speech Arena Elo op basis van blind luisteren; ASR gebruikt AA-WER v2, waar lager beter is; en native Speech-to-Speech gebruikt een gelijkgewogen samengestelde score van Big Bench Audio, Full Duplex Bench en τ-Voice, waar hoger beter is. Vergelijk scores alleen binnen hetzelfde leaderboard. Bron: artificialanalysis.ai.

Het Intelligence Index-bord komt van Artificial Analysis: het destilleert vele openbare benchmarks in een enkele 0-100 Intelligence Index, waarbij objectieve capaciteit wordt gemeten in plaats van subjectieve voorkeur — een natuurlijke aanvulling op arena.ai's menselijke blinde stemming. Bron: artificialanalysis.ai.