KI-Modell-Ranglisten

KI-Rankings aus mehreren Quellen für Chat, Sprache, TTS, ASR, Code, Bild, Video und Agenten — von arena.ai, OpenRouter und Artificial Analysis.

RangModellAnbieterElo ?Stimmen ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Quelle: arena.ai · Aktualisiert Aug 25, 2026 · PandaNpc Aktualisiert 29. Aug. 2026, 06:00 UTCVollständige Rangliste anzeigen →

Zahlen lesen

arena.ai (ehemals LMArena) zeigt den Nutzern zwei anonyme Antworten auf dieselbe Aufforderung und bittet sie, eine auszuwählen, und leitet dann eine Elo-Bewertung aus diesen Kämpfen ab. Es misst, welche Antwort die Leute bevorzugen – nicht die objektive Fähigkeit. Ein sympathischer Stil kann gewinnen, während eine gründliche, aber wortreiche Antwort verlieren kann.

Stimmen sind die Kämpfe, die ein Modell gesammelt hat. Ein neu gelistetes Modell hat wenige Stimmen und ein breites Konfidenzintervall, daher schwankt sein Rang leicht — lesen Sie den Rang immer zusammen mit dem ±-Intervall.

Das Agent-Board funktioniert anders als die anderen: Es misst reale Agent-Sitzungen anstatt Blindabstimmungspräferenzen. Seine Hauptkennzahl, Net Improvement, ist ein prozentualer Zuwachs – kein Elo-Wert – und kann daher nicht über Boards hinweg verglichen werden. arena.ai berichtet auf der vollständigen Rangliste auch fünf weitere Dimensionen (Confirmed Success, Steerability, Bash Recovery und andere).

Das Nutzungsboard stammt von OpenRouter und zählt den tatsächlichen API-Token-Anteil — Entwickler stimmen mit ihren Geldbörsen ab, was die subjektiven Präferenzboards ergänzt.

Die Sprach-Boards stammen von Artificial Analysis: TTS verwendet das Speech-Arena-Elo mit Blindanhörung; ASR verwendet AA-WER v2, wobei niedriger besser ist; und natives Speech-to-Speech verwendet einen gleichgewichteten zusammengesetzten Wert aus Big Bench Audio, Full Duplex Bench und τ-Voice, wobei höher besser ist. Vergleichen Sie Werte nur innerhalb desselben Boards. Quelle: artificialanalysis.ai.

Das Intelligence Index-Board stammt von Artificial Analysis: Es destilliert viele öffentliche Benchmarks in einen einzelnen Intelligence Index von 0-100, der objektive Fähigkeiten statt subjektiver Präferenzen misst – eine natürliche Ergänzung zu arena.ais menschlicher Blindabstimmung. Quelle: artificialanalysis.ai.