AI Model Ranglister
AI-rangeringer fra flere kilder til chat, tale, TTS, ASR, kode, billede, video og agenter — fra arena.ai, OpenRouter og Artificial Analysis.
| Rang | Model | Leverandør | Taleindeks ? |
|---|---|---|---|
| 1 | Qwen Audio 3.0 Realtime Plus | Alibaba | 84% |
| 2 | Grok Voice Think Fast 2.0 High | SpaceXAI | 82.7% |
| 3 | GPT-Realtime-2.1 High | OpenAI | 79.3% |
| 4 | GPT-Realtime-2 High | OpenAI | 77.3% |
| 5 | Qwen Audio 3.0 Realtime Flash | Alibaba | 76.3% |
| 6 | Grok Voice Think Fast 1.0 | SpaceXAI | 75.7% |
| 7 | GPT-Realtime-2 Medium | OpenAI | 75% |
| 8 | GPT-Realtime-2.1 Minimal | OpenAI | 72.7% |
| 9 | GPT-Realtime-1.5 | OpenAI | 72% |
| 10 | GPT Realtime (Aug 2025) | OpenAI | 69% |
| 11 | GPT-Realtime-2 Minimal | OpenAI | 66.3% |
| 12 | GPT-Realtime-2.1 Mini High | OpenAI | 65.3% |
| 13 | Grok Voice Agent | SpaceXAI | 64% |
| 14 | Deepslate Opal | Deepslate | 63% |
| 15 | Higgs Realtime | Boson AI | 60.3% |
Kilde: Artificial Analysis · Opdateret Aug 29, 2026 · PandaNpc Opdateret 29. aug. 2026, 06.00 UTCSe hele ranglisten →
Sådan læses disse tal
arena.ai (tidligere LMArena) viser brugere to anonyme svar på samme prompt og beder dem vælge ét, og udleder derefter en Elo-rating fra disse kampe. Det måler, hvilket svar folk foretrækker — ikke objektiv evne. En sympatisk stil kan vinde, mens et grundigt men ordrigt svar kan tabe.
Stemmer er de kampe, en model har akkumuleret. En nyligt tilføjet model har få stemmer og et bredt konfidensinterval, så dens rangering svinger let — læs altid rangeringen sammen med ±-intervallet.
Agent-tavlen fungerer anderledes end resten: den måler rigtige agentsessioner i stedet for blindafstemningspræference. Dens hovedmetrik, Net Improvement, er en procentvis stigning – ikke en Elo-rating – så den kan ikke sammenlignes på tværs af tavler. arena.ai rapporterer også fem yderligere dimensioner (Confirmed Success, Steerability, Bash Recovery og andre) på det fulde leaderboard.
Brugstavlen kommer fra OpenRouter og tæller reelle API-token-andele — udviklere stemmer med deres tegnebøger, hvilket supplerer de subjektive præferencetavler.
Tale-tavlerne stammer fra Artificial Analysis: TTS bruger blindlyttet Speech Arena Elo; ASR bruger AA-WER v2, hvor lavere er bedre; og native Speech-to-Speech bruger en ligevægtet sammensætning af Big Bench Audio, Full Duplex Bench og τ-Voice, hvor højere er bedre. Sammenlign kun scorer inden for samme tavle. Kilde: artificialanalysis.ai.
Intelligence Index-tavlen kommer fra Artificial Analysis: den destillerer mange offentlige benchmarks til en enkelt Intelligence Index fra 0-100, der måler objektiv kapacitet snarere end subjektiv præference — et naturligt supplement til arena.ai's menneskelige blinde afstemning. Kilde: artificialanalysis.ai.
