AI Model Ranglijsten

AI-ranglijsten van meerdere bronnen voor chat, spraak, TTS, ASR, code, beeld, video en agents — van arena.ai, OpenRouter en Artificial Analysis.

RangModelLeverancierElo ?Stemmen ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Bron: arena.ai · Bijgewerkt Aug 21, 2026 · PandaNpc Bijgewerkt 29 aug 2026, 06:00 UTCBekijk volledige ranglijst →

Hoe getallen lezen

arena.ai (voorheen LMArena) toont gebruikers twee anonieme antwoorden op dezelfde prompt en vraagt hen er één te kiezen, waarna het een Elo-rating afleidt uit die gevechten. Het meet welk antwoord mensen prefereren — niet objectieve capaciteit. Een sympathieke stijl kan winnen, terwijl een grondig maar breedsprakig antwoord kan verliezen.

Stemmen zijn de gevechten die een model heeft verzameld. Een nieuw vermeld model heeft weinig stemmen en een groot betrouwbaarheidsinterval, dus de rangorde schommelt gemakkelijk — lees de rang altijd samen met het ±-interval.

Het Agent-bord werkt anders dan de rest: het meet echte agentsessies in plaats van blinde stemvoorkeuren. De hoofdmetriek, Net Improvement, is een procentuele stijging — geen Elo-rating — dus het kan niet worden vergeleken tussen borden. arena.ai rapporteert ook vijf extra dimensies (Confirmed Success, Steerability, Bash Recovery en andere) op het volledige leaderboard.

Het gebruiksbord komt van OpenRouter en telt het daadwerkelijke API-tokenaandeel — ontwikkelaars stemmen met hun portemonnee, wat een aanvulling is op de subjectieve voorkeursborden.

De spraak-leaderboards komen van Artificial Analysis: TTS gebruikt Speech Arena Elo op basis van blind luisteren; ASR gebruikt AA-WER v2, waar lager beter is; en native Speech-to-Speech gebruikt een gelijkgewogen samengestelde score van Big Bench Audio, Full Duplex Bench en τ-Voice, waar hoger beter is. Vergelijk scores alleen binnen hetzelfde leaderboard. Bron: artificialanalysis.ai.

Het Intelligence Index-bord komt van Artificial Analysis: het destilleert vele openbare benchmarks in een enkele 0-100 Intelligence Index, waarbij objectieve capaciteit wordt gemeten in plaats van subjectieve voorkeur — een natuurlijke aanvulling op arena.ai's menselijke blinde stemming. Bron: artificialanalysis.ai.