KI-Modell-Ranglisten

KI-Rankings aus mehreren Quellen für Chat, Sprache, TTS, ASR, Code, Bild, Video und Agenten — von arena.ai, OpenRouter und Artificial Analysis.

RangModellAnbieterElo ?Stimmen ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Quelle: arena.ai · Aktualisiert Aug 21, 2026 · PandaNpc Aktualisiert 29. Aug. 2026, 06:00 UTCVollständige Rangliste anzeigen →

Zahlen lesen

arena.ai (ehemals LMArena) zeigt den Nutzern zwei anonyme Antworten auf dieselbe Aufforderung und bittet sie, eine auszuwählen, und leitet dann eine Elo-Bewertung aus diesen Kämpfen ab. Es misst, welche Antwort die Leute bevorzugen – nicht die objektive Fähigkeit. Ein sympathischer Stil kann gewinnen, während eine gründliche, aber wortreiche Antwort verlieren kann.

Stimmen sind die Kämpfe, die ein Modell gesammelt hat. Ein neu gelistetes Modell hat wenige Stimmen und ein breites Konfidenzintervall, daher schwankt sein Rang leicht — lesen Sie den Rang immer zusammen mit dem ±-Intervall.

Das Agent-Board funktioniert anders als die anderen: Es misst reale Agent-Sitzungen anstatt Blindabstimmungspräferenzen. Seine Hauptkennzahl, Net Improvement, ist ein prozentualer Zuwachs – kein Elo-Wert – und kann daher nicht über Boards hinweg verglichen werden. arena.ai berichtet auf der vollständigen Rangliste auch fünf weitere Dimensionen (Confirmed Success, Steerability, Bash Recovery und andere).

Das Nutzungsboard stammt von OpenRouter und zählt den tatsächlichen API-Token-Anteil — Entwickler stimmen mit ihren Geldbörsen ab, was die subjektiven Präferenzboards ergänzt.

Die Sprach-Boards stammen von Artificial Analysis: TTS verwendet das Speech-Arena-Elo mit Blindanhörung; ASR verwendet AA-WER v2, wobei niedriger besser ist; und natives Speech-to-Speech verwendet einen gleichgewichteten zusammengesetzten Wert aus Big Bench Audio, Full Duplex Bench und τ-Voice, wobei höher besser ist. Vergleichen Sie Werte nur innerhalb desselben Boards. Quelle: artificialanalysis.ai.

Das Intelligence Index-Board stammt von Artificial Analysis: Es destilliert viele öffentliche Benchmarks in einen einzelnen Intelligence Index von 0-100, der objektive Fähigkeiten statt subjektiver Präferenzen misst – eine natürliche Ergänzung zu arena.ais menschlicher Blindabstimmung. Quelle: artificialanalysis.ai.