KI-Modell-Ranglisten
KI-Rankings aus mehreren Quellen für Chat, Sprache, TTS, ASR, Code, Bild, Video und Agenten — von arena.ai, OpenRouter und Artificial Analysis.
| Rang | Modell | Anbieter | Speech Arena Elo ? |
|---|---|---|---|
| 1 | Sonic 3.6 | Cartesia | 1288 ±17 |
| 2 | Qwen-Audio-3.0-TTS-Plus | Alibaba | 1243 ±14 |
| 3 | Simba 3.2 | SpeechifyAI | 1239 ±14 |
| 4 | Realtime TTS-2 Flash - Research Preview | Inworld | 1226 ±15 |
| 5 | Luna TTS | VUI Labs | 1225 ±13 |
| 6 | Breeze TTS 2 | BreezeBlue | 1221 ±17 |
| 7 | v3 Conversational | ElevenLabs | 1215 ±15 |
| 8 | Gemini 3.1 Flash TTS | 1209 ±12 | |
| 9 | StepAudio 2.5 TTS | StepFun | 1206 ±14 |
| 10 | Realtime TTS 1.5 Max | Inworld | 1198 ±12 |
| 11 | Sonic 3.5 | Cartesia | 1197 ±12 |
| 12 | Lightning V3.1 Pro (Jul 2026) | Smallest.ai | 1196 ±14 |
| 13 | Realtime TTS-2 - Research Preview | Inworld | 1186 ±12 |
| 14 | Soniox TTS Real-Time v2 | Soniox | 1182 ±11 |
| 15 | Eleven v3 | ElevenLabs | 1180 ±11 |
Quelle: Artificial Analysis · Aktualisiert Aug 29, 2026 · PandaNpc Aktualisiert 29. Aug. 2026, 06:00 UTCVollständige Rangliste anzeigen →
Zahlen lesen
arena.ai (ehemals LMArena) zeigt den Nutzern zwei anonyme Antworten auf dieselbe Aufforderung und bittet sie, eine auszuwählen, und leitet dann eine Elo-Bewertung aus diesen Kämpfen ab. Es misst, welche Antwort die Leute bevorzugen – nicht die objektive Fähigkeit. Ein sympathischer Stil kann gewinnen, während eine gründliche, aber wortreiche Antwort verlieren kann.
Stimmen sind die Kämpfe, die ein Modell gesammelt hat. Ein neu gelistetes Modell hat wenige Stimmen und ein breites Konfidenzintervall, daher schwankt sein Rang leicht — lesen Sie den Rang immer zusammen mit dem ±-Intervall.
Das Agent-Board funktioniert anders als die anderen: Es misst reale Agent-Sitzungen anstatt Blindabstimmungspräferenzen. Seine Hauptkennzahl, Net Improvement, ist ein prozentualer Zuwachs – kein Elo-Wert – und kann daher nicht über Boards hinweg verglichen werden. arena.ai berichtet auf der vollständigen Rangliste auch fünf weitere Dimensionen (Confirmed Success, Steerability, Bash Recovery und andere).
Das Nutzungsboard stammt von OpenRouter und zählt den tatsächlichen API-Token-Anteil — Entwickler stimmen mit ihren Geldbörsen ab, was die subjektiven Präferenzboards ergänzt.
Die Sprach-Boards stammen von Artificial Analysis: TTS verwendet das Speech-Arena-Elo mit Blindanhörung; ASR verwendet AA-WER v2, wobei niedriger besser ist; und natives Speech-to-Speech verwendet einen gleichgewichteten zusammengesetzten Wert aus Big Bench Audio, Full Duplex Bench und τ-Voice, wobei höher besser ist. Vergleichen Sie Werte nur innerhalb desselben Boards. Quelle: artificialanalysis.ai.
Das Intelligence Index-Board stammt von Artificial Analysis: Es destilliert viele öffentliche Benchmarks in einen einzelnen Intelligence Index von 0-100, der objektive Fähigkeiten statt subjektiver Präferenzen misst – eine natürliche Ergänzung zu arena.ais menschlicher Blindabstimmung. Quelle: artificialanalysis.ai.
