AI Modell Ranglisták
Többforrású AI-rangsorok csevegés, beszéd, TTS, ASR, kód, kép, videó és ügynökök terén — az arena.ai, OpenRouter és Artificial Analysis által.
| Helyezés | Modell | Gyártó | Részesedés % ? | Tokens ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-5.6-luna-20260709 | OpenAI | 11.9% | 1.7T | 0.200 | 1.20 | 0.020 |
| 2 | deepseek-v4-flash-20260731 | DeepSeek | 11.3% | 1.6T | 0.030 | 0.100 | 0.0070 |
| 3 | mimo-v2.5-20260422 | Xiaomi | 11.1% | 1.6T | 0.140 | 0.280 | 0.0028 |
| 4 | glm-5.3-flash-20260826 | Zhipu | 10.9% | 1.6T | 0.075 | 0.250 | 0.015 |
| 5 | hy3-20260706 | Tencent | 6.8% | 963.0B | 0.132 | 0.528 | 0.033 |
| 6 | nemotron-3-ultra-550b-a55b-20260604 | Nvidia | 5.3% | 750.2B | 0.500 | 2.20 | 0.100 |
| 7 | deepseek-v4-flash-20260423 | DeepSeek | 5% | 711.5B | 0.030 | 0.100 | 0.0070 |
| 8 | minimax-m3-20260531 | MiniMax | 4.2% | 605.1B | 0.300 | 1.20 | 0.060 |
| 9 | hy4-preview-20260827 | Tencent | 2.6% | 363.8B | 0.834 | 2.50 | 0.042 |
| 10 | gemini-3.7-flash-20260813 | 2.5% | 353.6B | 0.750 | 3.75 | 0.075 | |
| 11 | glm-5.2-20260616 | Zhipu | 2.4% | 338.1B | 1.19 | 3.74 | 0.221 |
| 12 | gpt-5.6-sol-20260709 | OpenAI | 1.7% | 248.2B | 2.00 | 10.0 | 0.200 |
| 13 | deepseek-v4-pro-20260423 | DeepSeek | 1.6% | 233.3B | 0.660 | 1.98 | 0.022 |
| 14 | kimi-k3-20260715 | Moonshot | 1.6% | 226.0B | 3.00 | 15.0 | 0.300 |
| 15 | claude-opus-5-20260723 | Anthropic | 1.5% | 220.7B | 5.00 | 25.0 | 0.500 |
Forrás: OpenRouter · Frissítve 2026-08-28 · PandaNpc Frissítve 2026. aug. 29. 06:00 UTCTeljes ranglista megtekintése →
Számok olvasása
arena.ai (korábban LMArena) két névtelen választ mutat a felhasználóknak ugyanarra a promptra, és megkéri őket, hogy válasszanak egyet, majd ezekből a küzdelmekből származtat egy Elo-pontszámot. Azt méri, hogy az emberek melyik választ preferálják – nem az objektív képességet. Egy szimpatikus stílus nyerhet, míg egy precíz, de bőbeszédű válasz veszíthet.
A szavazatok a modell által felhalmozott csaták. Egy újonnan listázott modellnek kevés szavazata van és széles a konfidenciaintervalluma, így a rangja könnyen ingadozik — mindig a rangot a ± intervallummal együtt olvassa.
Az Ágens tábla másképp működik, mint a többi: valódi ágens munkameneteket mér, nem pedig vak szavazati preferenciákat. Fő mutatója, a Net Improvement, százalékos növekedés – nem Elo-pontszám –, így nem hasonlítható össze a táblák között. Az arena.ai további öt dimenziót is jelent (Confirmed Success, Steerability, Bash Recovery és mások) a teljes ranglistán.
A használati tábla az OpenRouter-tól származik, és a valós API token megosztást számolja – a fejlesztők a pénztárcájukkal szavaznak, ami kiegészíti a szubjektív preferencia táblákat.
A beszéd-rangsorok az Artificial Analysis-től származnak: a TTS vakon hallgatott Speech Arena Elo-t használ; az ASR az AA-WER v2-t használja, ahol az alacsonyabb jobb; a natív Speech-to-Speech pedig a Big Bench Audio, Full Duplex Bench és τ-Voice egyenlő súlyú kompozitját használja, ahol a magasabb jobb. Csak ugyanazon a rangsoron belül hasonlítsa össze a pontszámokat. Forrás: artificialanalysis.ai.
Az Intelligence Index tábla az Artificial Analysis-től származik: számos nyilvános benchmarkot egyetlen 0-100-as Intelligence Index-szé sűrít, amely az objektív képességet méri a szubjektív preferencia helyett — természetes kiegészítője az arena.ai emberi vak szavazatának. Forrás: artificialanalysis.ai.
