AI Model Ranglijsten

AI-ranglijsten van meerdere bronnen voor chat, spraak, TTS, ASR, code, beeld, video en agents — van arena.ai, OpenRouter en Artificial Analysis.

RangModelLeverancierElo ?Stemmen ?
1MiniMaxminimax-h3MiniMax1489 ±713,020
2Bytedancedreamina-seedance-2.5-720pBytedance1484 ±122,912
3Bytedancedreamina-seedance-2.0-720pBytedance1478 ±8105,298
4Googlegemini-omni-flashGoogle1462 ±654,179
5SpaceXAIgrok-imagine-video-1.5-720pSpaceXAI1460 ±599,649
6Black Forest Labsflux-3-video-20260811Black Forest Labs1449 ±103,770
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1442 ±1070,772
8Alibabawan2.7-i2vAlibaba1427 ±557,878
9SpaceXAIgrok-imagine-video-720pSpaceXAI1415 ±5517,108
10Googleveo-3.1-audioGoogle1397 ±1125,156
11Googleveo-3.1-audio-1080pGoogle1390 ±953,179
12Googleveo-3.1-fast-audioGoogle1384 ±999,932
13SpaceXAIgrok-imagine-video-480pSpaceXAI1384 ±819,443
14Googleveo-3.1-fast-audio-1080pGoogle1371 ±1054,455
15Shengshuvidu-q3-proShengshu1362 ±936,723

Bron: arena.ai · Bijgewerkt Aug 14, 2026 · PandaNpc Bijgewerkt 29 aug 2026, 06:00 UTCBekijk volledige ranglijst →

Hoe getallen lezen

arena.ai (voorheen LMArena) toont gebruikers twee anonieme antwoorden op dezelfde prompt en vraagt hen er één te kiezen, waarna het een Elo-rating afleidt uit die gevechten. Het meet welk antwoord mensen prefereren — niet objectieve capaciteit. Een sympathieke stijl kan winnen, terwijl een grondig maar breedsprakig antwoord kan verliezen.

Stemmen zijn de gevechten die een model heeft verzameld. Een nieuw vermeld model heeft weinig stemmen en een groot betrouwbaarheidsinterval, dus de rangorde schommelt gemakkelijk — lees de rang altijd samen met het ±-interval.

Het Agent-bord werkt anders dan de rest: het meet echte agentsessies in plaats van blinde stemvoorkeuren. De hoofdmetriek, Net Improvement, is een procentuele stijging — geen Elo-rating — dus het kan niet worden vergeleken tussen borden. arena.ai rapporteert ook vijf extra dimensies (Confirmed Success, Steerability, Bash Recovery en andere) op het volledige leaderboard.

Het gebruiksbord komt van OpenRouter en telt het daadwerkelijke API-tokenaandeel — ontwikkelaars stemmen met hun portemonnee, wat een aanvulling is op de subjectieve voorkeursborden.

De spraak-leaderboards komen van Artificial Analysis: TTS gebruikt Speech Arena Elo op basis van blind luisteren; ASR gebruikt AA-WER v2, waar lager beter is; en native Speech-to-Speech gebruikt een gelijkgewogen samengestelde score van Big Bench Audio, Full Duplex Bench en τ-Voice, waar hoger beter is. Vergelijk scores alleen binnen hetzelfde leaderboard. Bron: artificialanalysis.ai.

Het Intelligence Index-bord komt van Artificial Analysis: het destilleert vele openbare benchmarks in een enkele 0-100 Intelligence Index, waarbij objectieve capaciteit wordt gemeten in plaats van subjectieve voorkeur — een natuurlijke aanvulling op arena.ai's menselijke blinde stemming. Bron: artificialanalysis.ai.