AI Model Ranglijsten

AI-ranglijsten van meerdere bronnen voor chat, spraak, TTS, ASR, code, beeld, video en agents — van arena.ai, OpenRouter en Artificial Analysis.

RangModelLeverancierElo ?Stemmen ?Input ?OutputCache ?
1OpenAIgpt-5.6-sol-xhighOpenAI1257 ±729,6632.0010.00.200
2Anthropicclaude-opus-4-6-searchAnthropic1253 ±5134,6995.0025.00.500
3OpenAIgpt-5.5-searchOpenAI1242 ±589,8735.0030.00.500
4Anthropicclaude-opus-4-7Anthropic1233 ±591,3945.0025.00.500
5Anthropicclaude-fable-5Anthropic1230 ±841,79510.050.01.00
6Baiduernie-5.1Baidu1227 ±103,788
7Anthropicclaude-sonnet-4-6-searchAnthropic1221 ±5134,9053.0015.00.300
8SpaceXAIgrok-4.5SpaceXAI1213 ±731,5052.006.000.300
9Googlegemini-3.1-pro-groundingGoogle1210 ±5113,2822.0012.00.200
10Googlegemini-3-pro-groundingGoogle1207 ±637,024
11OpenAIgpt-5.2-searchOpenAI1207 ±652,7121.7514.00.175
12Anthropicclaude-opus-4-8Anthropic1204 ±670,9985.0025.00.500
13SpaceXAIgrok-4.20-multi-agent-beta-0309SpaceXAI1204 ±5109,5531.252.500.200
14OpenAIgpt-5.1-searchOpenAI1199 ±559,9091.2510.00.125
15Googlegemini-3-flash-groundingGoogle1198 ±5149,3340.5003.000.050

Bron: arena.ai · Bijgewerkt Aug 24, 2026 · PandaNpc Bijgewerkt 29 aug 2026, 06:00 UTCBekijk volledige ranglijst →

Hoe getallen lezen

arena.ai (voorheen LMArena) toont gebruikers twee anonieme antwoorden op dezelfde prompt en vraagt hen er één te kiezen, waarna het een Elo-rating afleidt uit die gevechten. Het meet welk antwoord mensen prefereren — niet objectieve capaciteit. Een sympathieke stijl kan winnen, terwijl een grondig maar breedsprakig antwoord kan verliezen.

Stemmen zijn de gevechten die een model heeft verzameld. Een nieuw vermeld model heeft weinig stemmen en een groot betrouwbaarheidsinterval, dus de rangorde schommelt gemakkelijk — lees de rang altijd samen met het ±-interval.

Het Agent-bord werkt anders dan de rest: het meet echte agentsessies in plaats van blinde stemvoorkeuren. De hoofdmetriek, Net Improvement, is een procentuele stijging — geen Elo-rating — dus het kan niet worden vergeleken tussen borden. arena.ai rapporteert ook vijf extra dimensies (Confirmed Success, Steerability, Bash Recovery en andere) op het volledige leaderboard.

Het gebruiksbord komt van OpenRouter en telt het daadwerkelijke API-tokenaandeel — ontwikkelaars stemmen met hun portemonnee, wat een aanvulling is op de subjectieve voorkeursborden.

De spraak-leaderboards komen van Artificial Analysis: TTS gebruikt Speech Arena Elo op basis van blind luisteren; ASR gebruikt AA-WER v2, waar lager beter is; en native Speech-to-Speech gebruikt een gelijkgewogen samengestelde score van Big Bench Audio, Full Duplex Bench en τ-Voice, waar hoger beter is. Vergelijk scores alleen binnen hetzelfde leaderboard. Bron: artificialanalysis.ai.

Het Intelligence Index-bord komt van Artificial Analysis: het destilleert vele openbare benchmarks in een enkele 0-100 Intelligence Index, waarbij objectieve capaciteit wordt gemeten in plaats van subjectieve voorkeur — een natuurlijke aanvulling op arena.ai's menselijke blinde stemming. Bron: artificialanalysis.ai.