AI-modelltopplistor
Flerkälliga AI-rankningar för chatt, tal, TTS, ASR, kod, bild, video och agenter — från arena.ai, OpenRouter och Artificial Analysis.
| Rank | Modell | Leverantör | Talindex ? |
|---|---|---|---|
| 1 | Qwen Audio 3.0 Realtime Plus | Alibaba | 84% |
| 2 | Grok Voice Think Fast 2.0 High | SpaceXAI | 82.7% |
| 3 | GPT-Realtime-2.1 High | OpenAI | 79.3% |
| 4 | GPT-Realtime-2 High | OpenAI | 77.3% |
| 5 | Qwen Audio 3.0 Realtime Flash | Alibaba | 76.3% |
| 6 | Grok Voice Think Fast 1.0 | SpaceXAI | 75.7% |
| 7 | GPT-Realtime-2 Medium | OpenAI | 75% |
| 8 | GPT-Realtime-2.1 Minimal | OpenAI | 72.7% |
| 9 | GPT-Realtime-1.5 | OpenAI | 72% |
| 10 | GPT Realtime (Aug 2025) | OpenAI | 69% |
| 11 | GPT-Realtime-2 Minimal | OpenAI | 66.3% |
| 12 | GPT-Realtime-2.1 Mini High | OpenAI | 65.3% |
| 13 | Grok Voice Agent | SpaceXAI | 64% |
| 14 | Deepslate Opal | Deepslate | 63% |
| 15 | Higgs Realtime | Boson AI | 60.3% |
Källa: Artificial Analysis · Uppdaterad Aug 29, 2026 · PandaNpc Uppdaterad 29 aug. 2026 06:00 UTCVisa hela topplistan →
Läsa dessa siffror
arena.ai (tidigare LMArena) visar användarna två anonyma svar på samma prompt och ber dem välja ett, och härleder sedan ett Elo-betyg från dessa matcher. Det mäter vilket svar folk föredrar — inte objektiv förmåga. En tilltalande stil kan vinna, medan ett noggrant men omständligt svar kan förlora.
Röster är de strider en modell har samlat på sig. En nyligen listad modell har få röster och ett brett konfidensintervall, så dess rankning svänger lätt — läs alltid rankningen tillsammans med ±-intervallet.
Agent-tavlan fungerar annorlunda än de andra: den mäter verkliga agentsessioner istället för blindröstpreferens. Dess huvudmått, Net Improvement, är en procentuell ökning — inte ett Elo-betyg — så det kan inte jämföras över tavlor. arena.ai rapporterar även ytterligare fem dimensioner (Confirmed Success, Steerability, Bash Recovery och andra) på den fullständiga ledartavlan.
Användningstavlan kommer från OpenRouter och räknar verklig API-tokenandel — utvecklare som röstar med sina plånböcker, vilket kompletterar de subjektiva preferenstavlorna.
Taltavlorna kommer från Artificial Analysis: TTS använder blindlyssnad Speech Arena Elo; ASR använder AA-WER v2, där lägre är bättre; och inbyggd Speech-to-Speech använder en likaviktad sammansättning av Big Bench Audio, Full Duplex Bench och τ-Voice, där högre är bättre. Jämför poäng endast inom samma tavla. Källa: artificialanalysis.ai.
Intelligence Index-tavlan kommer från Artificial Analysis: den destillerar många offentliga riktmärken till ett enda Intelligence Index från 0 till 100, som mäter objektiv förmåga snarare än subjektiv preferens — ett naturligt komplement till arena.ais mänskliga blindomröstning. Källa: artificialanalysis.ai.
