Rankingi modeli AI
Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.
| Miejsce | Model | Dostawca | Udział % ? | Tokens ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-5.6-luna-20260709 | OpenAI | 11.9% | 1.7T | 0.200 | 1.20 | 0.020 |
| 2 | deepseek-v4-flash-20260731 | DeepSeek | 11.3% | 1.6T | 0.030 | 0.100 | 0.0070 |
| 3 | mimo-v2.5-20260422 | Xiaomi | 11.1% | 1.6T | 0.140 | 0.280 | 0.0028 |
| 4 | glm-5.3-flash-20260826 | Zhipu | 10.9% | 1.6T | 0.075 | 0.250 | 0.015 |
| 5 | hy3-20260706 | Tencent | 6.8% | 963.0B | 0.132 | 0.528 | 0.033 |
| 6 | nemotron-3-ultra-550b-a55b-20260604 | Nvidia | 5.3% | 750.2B | 0.500 | 2.20 | 0.100 |
| 7 | deepseek-v4-flash-20260423 | DeepSeek | 5% | 711.5B | 0.030 | 0.100 | 0.0070 |
| 8 | minimax-m3-20260531 | MiniMax | 4.2% | 605.1B | 0.300 | 1.20 | 0.060 |
| 9 | hy4-preview-20260827 | Tencent | 2.6% | 363.8B | 0.834 | 2.50 | 0.042 |
| 10 | gemini-3.7-flash-20260813 | 2.5% | 353.6B | 0.750 | 3.75 | 0.075 | |
| 11 | glm-5.2-20260616 | Zhipu | 2.4% | 338.1B | 1.19 | 3.74 | 0.221 |
| 12 | gpt-5.6-sol-20260709 | OpenAI | 1.7% | 248.2B | 2.00 | 10.0 | 0.200 |
| 13 | deepseek-v4-pro-20260423 | DeepSeek | 1.6% | 233.3B | 0.660 | 1.98 | 0.022 |
| 14 | kimi-k3-20260715 | Moonshot | 1.6% | 226.0B | 3.00 | 15.0 | 0.300 |
| 15 | claude-opus-5-20260723 | Anthropic | 1.5% | 220.7B | 5.00 | 25.0 | 0.500 |
Źródło: OpenRouter · Aktualizacja 2026-08-28 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →
Jak czytać te liczby
arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.
Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.
Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.
Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.
Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.
Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.
