AI Model Ranglijsten

AI-ranglijsten van meerdere bronnen voor chat, spraak, TTS, ASR, code, beeld, video en agents — van arena.ai, OpenRouter en Artificial Analysis.

RangModelLeverancierElo ?Stemmen ?
1Googlegemini-omni-flashGoogle1512 ±1116,916
2Black Forest Labsflux-3-videoBlack Forest Labs1494 ±171,291
3Bytedancedreamina-seedance-2.0-720pBytedance1482 ±1049,058
4Bytedancedreamina-seedance-2.5-720pBytedance1477 ±191,337
5Metamuse-videoMeta1457 ±152,176
6MiniMaxminimax-h3MiniMax1453 ±133,081
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1428 ±1322,113
8OpenAIsora-2-proOpenAI1364 ±746,509
9Googleveo-3.1-audioGoogle1364 ±1413,743
10Googleveo-3.1-audio-1080pGoogle1363 ±1024,979
11Googleveo-3.1-fast-audioGoogle1361 ±1039,441
12Googleveo-3.1-fast-audio-1080pGoogle1358 ±1025,771
13Googleveo-3-fast-audioGoogle1347 ±1125,219
14SpaceXAIgrok-imagine-video-720pSpaceXAI1345 ±7154,827
15Alibabawan2.7-t2vAlibaba1344 ±917,769

Bron: arena.ai · Bijgewerkt Aug 14, 2026 · PandaNpc Bijgewerkt 29 aug 2026, 06:00 UTCBekijk volledige ranglijst →

Hoe getallen lezen

arena.ai (voorheen LMArena) toont gebruikers twee anonieme antwoorden op dezelfde prompt en vraagt hen er één te kiezen, waarna het een Elo-rating afleidt uit die gevechten. Het meet welk antwoord mensen prefereren — niet objectieve capaciteit. Een sympathieke stijl kan winnen, terwijl een grondig maar breedsprakig antwoord kan verliezen.

Stemmen zijn de gevechten die een model heeft verzameld. Een nieuw vermeld model heeft weinig stemmen en een groot betrouwbaarheidsinterval, dus de rangorde schommelt gemakkelijk — lees de rang altijd samen met het ±-interval.

Het Agent-bord werkt anders dan de rest: het meet echte agentsessies in plaats van blinde stemvoorkeuren. De hoofdmetriek, Net Improvement, is een procentuele stijging — geen Elo-rating — dus het kan niet worden vergeleken tussen borden. arena.ai rapporteert ook vijf extra dimensies (Confirmed Success, Steerability, Bash Recovery en andere) op het volledige leaderboard.

Het gebruiksbord komt van OpenRouter en telt het daadwerkelijke API-tokenaandeel — ontwikkelaars stemmen met hun portemonnee, wat een aanvulling is op de subjectieve voorkeursborden.

De spraak-leaderboards komen van Artificial Analysis: TTS gebruikt Speech Arena Elo op basis van blind luisteren; ASR gebruikt AA-WER v2, waar lager beter is; en native Speech-to-Speech gebruikt een gelijkgewogen samengestelde score van Big Bench Audio, Full Duplex Bench en τ-Voice, waar hoger beter is. Vergelijk scores alleen binnen hetzelfde leaderboard. Bron: artificialanalysis.ai.

Het Intelligence Index-bord komt van Artificial Analysis: het destilleert vele openbare benchmarks in een enkele 0-100 Intelligence Index, waarbij objectieve capaciteit wordt gemeten in plaats van subjectieve voorkeur — een natuurlijke aanvulling op arena.ai's menselijke blinde stemming. Bron: artificialanalysis.ai.