Rankingi modeli AI

Wieloźródłowe rankingi AI dla czatu, mowy, TTS, ASR, kodu, obrazu, wideo i agentów — z arena.ai, OpenRouter i Artificial Analysis.

MiejsceModelDostawcaElo ?Głosy ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Źródło: arena.ai · Aktualizacja Aug 25, 2026 · PandaNpc Aktualizacja 29 sie 2026, 06:00 UTCZobacz pełny ranking →

Jak czytać te liczby

arena.ai (dawniej LMArena) pokazuje użytkownikom dwie anonimowe odpowiedzi na to samo pytanie i prosi o wybór jednej, a następnie wylicza ranking Elo na podstawie tych starć. Mierzy, którą odpowiedź ludzie wolą — a nie obiektywne możliwości. Lubiany styl może wygrać, podczas gdy rygorystyczna, ale rozwlekła odpowiedź może przegrać.

Głosy to walki, które model zgromadził. Nowo dodany model ma niewiele głosów i szeroki przedział ufności, więc jego ranga łatwo się waha — zawsze czytaj rangę wraz z przedziałem ±.

Panel Agentów działa inaczej niż pozostałe: mierzy rzeczywiste sesje agentów, a nie preferencje z ślepych głosowań. Jego główna metryka, Net Improvement, to procentowy przyrost — a nie rating Elo — więc nie można go porównywać między panelami. arena.ai raportuje także pięć dodatkowych wymiarów (Confirmed Success, Steerability, Bash Recovery i inne) na pełnej liście rankingowej.

Tablica użycia pochodzi z OpenRouter i zlicza rzeczywisty udział tokenów API — programiści głosują portfelami, co uzupełnia subiektywne tablice preferencji.

Panele mowy pochodzą z Artificial Analysis: TTS używa ślepego odsłuchu Speech Arena Elo; ASR używa AA-WER v2, gdzie niższy wynik jest lepszy; a natywny Speech-to-Speech używa równo ważonego złożenia Big Bench Audio, Full Duplex Bench i τ-Voice, gdzie wyższy wynik jest lepszy. Porównuj wyniki tylko w obrębie tego samego panelu. Źródło: artificialanalysis.ai.

Tablica Intelligence Index pochodzi od Artificial Analysis: destyluje ona wiele publicznych benchmarków w pojedynczy wskaźnik Intelligence Index od 0 do 100, mierzący obiektywną zdolność, a nie subiektywne preferencje — naturalne uzupełnienie dla ludzkiego ślepego głosowania arena.ai. Źródło: artificialanalysis.ai.