Rankingi modeli AI

Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.

MiejsceModelDostawcaIndeks Inteligencji ?Input ?OutputCache ?
1AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic63.15.0025.00.500
2AnthropicClaude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic62.55.0025.00.500
3AnthropicClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.110.050.01.00
4AnthropicClaude Opus 5 (Adaptive Reasoning, High Effort)Anthropic61.55.0025.00.500
5OpenAIGPT-5.6 Sol (max)OpenAI60.92.0010.00.200
6SpaceXAIGrok 4.6 (high)SpaceXAI60.92.006.000.500
7SpaceXAIGrok 4.6 (xhigh)SpaceXAI602.006.000.500
8KimiKimi K3 (max)Kimi59.73.0015.00.300
9Z AIGLM-5.3 (max)Z AI59.51.404.400.260
10OpenAIGPT-5.6 Sol (xhigh)OpenAI592.0010.00.200
11SpaceXAIGrok 4.6 (medium)SpaceXAI592.006.000.500
12AnthropicClaude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic58.65.0025.00.500
13AlibabaQwen3.8 MaxAlibaba58.12.006.000.250
14AlibabaQwen3.8 2.4T A95BAlibaba57.72.006.000.250
15Z AIGLM-5.3-FlashZ AI57.50.0750.2500.015

Źródło: Artificial Analysis · Aktualizacja Aug 29, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →

Jak czytać te liczby

arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.

Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.

Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.

Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.

Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.

Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.