KI-Modell-Ranglisten

KI-Rankings aus mehreren Quellen für Chat, Sprache, TTS, ASR, Code, Bild, Video und Agenten — von arena.ai, OpenRouter und Artificial Analysis.

RangModellAnbieterIntelligenzindex ?Input ?OutputCache ?
1AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic63.15.0025.00.500
2AnthropicClaude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic62.55.0025.00.500
3AnthropicClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.110.050.01.00
4AnthropicClaude Opus 5 (Adaptive Reasoning, High Effort)Anthropic61.55.0025.00.500
5OpenAIGPT-5.6 Sol (max)OpenAI60.92.0010.00.200
6SpaceXAIGrok 4.6 (high)SpaceXAI60.92.006.000.500
7SpaceXAIGrok 4.6 (xhigh)SpaceXAI602.006.000.500
8KimiKimi K3 (max)Kimi59.73.0015.00.300
9Z AIGLM-5.3 (max)Z AI59.51.404.400.260
10OpenAIGPT-5.6 Sol (xhigh)OpenAI592.0010.00.200
11SpaceXAIGrok 4.6 (medium)SpaceXAI592.006.000.500
12AnthropicClaude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic58.65.0025.00.500
13AlibabaQwen3.8 MaxAlibaba58.12.006.000.250
14AlibabaQwen3.8 2.4T A95BAlibaba57.72.006.000.250
15Z AIGLM-5.3-FlashZ AI57.50.0750.2500.015

Quelle: Artificial Analysis · Aktualisiert Aug 29, 2026 · PandaNpc Aktualisiert 29. Aug. 2026, 06:00 UTCVollständige Rangliste anzeigen →

Zahlen lesen

arena.ai (ehemals LMArena) zeigt den Nutzern zwei anonyme Antworten auf dieselbe Aufforderung und bittet sie, eine auszuwählen, und leitet dann eine Elo-Bewertung aus diesen Kämpfen ab. Es misst, welche Antwort die Leute bevorzugen – nicht die objektive Fähigkeit. Ein sympathischer Stil kann gewinnen, während eine gründliche, aber wortreiche Antwort verlieren kann.

Stimmen sind die Kämpfe, die ein Modell gesammelt hat. Ein neu gelistetes Modell hat wenige Stimmen und ein breites Konfidenzintervall, daher schwankt sein Rang leicht — lesen Sie den Rang immer zusammen mit dem ±-Intervall.

Das Agent-Board funktioniert anders als die anderen: Es misst reale Agent-Sitzungen anstatt Blindabstimmungspräferenzen. Seine Hauptkennzahl, Net Improvement, ist ein prozentualer Zuwachs – kein Elo-Wert – und kann daher nicht über Boards hinweg verglichen werden. arena.ai berichtet auf der vollständigen Rangliste auch fünf weitere Dimensionen (Confirmed Success, Steerability, Bash Recovery und andere).

Das Nutzungsboard stammt von OpenRouter und zählt den tatsächlichen API-Token-Anteil — Entwickler stimmen mit ihren Geldbörsen ab, was die subjektiven Präferenzboards ergänzt.

Die Sprach-Boards stammen von Artificial Analysis: TTS verwendet das Speech-Arena-Elo mit Blindanhörung; ASR verwendet AA-WER v2, wobei niedriger besser ist; und natives Speech-to-Speech verwendet einen gleichgewichteten zusammengesetzten Wert aus Big Bench Audio, Full Duplex Bench und τ-Voice, wobei höher besser ist. Vergleichen Sie Werte nur innerhalb desselben Boards. Quelle: artificialanalysis.ai.

Das Intelligence Index-Board stammt von Artificial Analysis: Es destilliert viele öffentliche Benchmarks in einen einzelnen Intelligence Index von 0-100, der objektive Fähigkeiten statt subjektiver Präferenzen misst – eine natürliche Ergänzung zu arena.ais menschlicher Blindabstimmung. Quelle: artificialanalysis.ai.