KI-Modell-Ranglisten

KI-Rankings aus mehreren Quellen für Chat, Sprache, TTS, ASR, Code, Bild, Video und Agenten — von arena.ai, OpenRouter und Artificial Analysis.

RangModellAnbieterElo ?Stimmen ?
1Googlegemini-omni-flashGoogle1512 ±1116,916
2Black Forest Labsflux-3-videoBlack Forest Labs1494 ±171,291
3Bytedancedreamina-seedance-2.0-720pBytedance1482 ±1049,058
4Bytedancedreamina-seedance-2.5-720pBytedance1477 ±191,337
5Metamuse-videoMeta1457 ±152,176
6MiniMaxminimax-h3MiniMax1453 ±133,081
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1428 ±1322,113
8OpenAIsora-2-proOpenAI1364 ±746,509
9Googleveo-3.1-audioGoogle1364 ±1413,743
10Googleveo-3.1-audio-1080pGoogle1363 ±1024,979
11Googleveo-3.1-fast-audioGoogle1361 ±1039,441
12Googleveo-3.1-fast-audio-1080pGoogle1358 ±1025,771
13Googleveo-3-fast-audioGoogle1347 ±1125,219
14SpaceXAIgrok-imagine-video-720pSpaceXAI1345 ±7154,827
15Alibabawan2.7-t2vAlibaba1344 ±917,769

Quelle: arena.ai · Aktualisiert Aug 14, 2026 · PandaNpc Aktualisiert 29. Aug. 2026, 06:00 UTCVollständige Rangliste anzeigen →

Zahlen lesen

arena.ai (ehemals LMArena) zeigt den Nutzern zwei anonyme Antworten auf dieselbe Aufforderung und bittet sie, eine auszuwählen, und leitet dann eine Elo-Bewertung aus diesen Kämpfen ab. Es misst, welche Antwort die Leute bevorzugen – nicht die objektive Fähigkeit. Ein sympathischer Stil kann gewinnen, während eine gründliche, aber wortreiche Antwort verlieren kann.

Stimmen sind die Kämpfe, die ein Modell gesammelt hat. Ein neu gelistetes Modell hat wenige Stimmen und ein breites Konfidenzintervall, daher schwankt sein Rang leicht — lesen Sie den Rang immer zusammen mit dem ±-Intervall.

Das Agent-Board funktioniert anders als die anderen: Es misst reale Agent-Sitzungen anstatt Blindabstimmungspräferenzen. Seine Hauptkennzahl, Net Improvement, ist ein prozentualer Zuwachs – kein Elo-Wert – und kann daher nicht über Boards hinweg verglichen werden. arena.ai berichtet auf der vollständigen Rangliste auch fünf weitere Dimensionen (Confirmed Success, Steerability, Bash Recovery und andere).

Das Nutzungsboard stammt von OpenRouter und zählt den tatsächlichen API-Token-Anteil — Entwickler stimmen mit ihren Geldbörsen ab, was die subjektiven Präferenzboards ergänzt.

Die Sprach-Boards stammen von Artificial Analysis: TTS verwendet das Speech-Arena-Elo mit Blindanhörung; ASR verwendet AA-WER v2, wobei niedriger besser ist; und natives Speech-to-Speech verwendet einen gleichgewichteten zusammengesetzten Wert aus Big Bench Audio, Full Duplex Bench und τ-Voice, wobei höher besser ist. Vergleichen Sie Werte nur innerhalb desselben Boards. Quelle: artificialanalysis.ai.

Das Intelligence Index-Board stammt von Artificial Analysis: Es destilliert viele öffentliche Benchmarks in einen einzelnen Intelligence Index von 0-100, der objektive Fähigkeiten statt subjektiver Präferenzen misst – eine natürliche Ergänzung zu arena.ais menschlicher Blindabstimmung. Quelle: artificialanalysis.ai.