Лідерборди AI моделей

Багатоджерельні рейтинги ШІ для чату, мовлення, TTS, ASR, коду, зображень, відео та агентів — від arena.ai, OpenRouter та Artificial Analysis.

МісцеМодельПостачальникElo ?Голоси ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Джерело: arena.ai · Оновлено Aug 25, 2026 · PandaNpc Оновлено 29 серп. 2026 р., 06:00 UTCПереглянути повну таблицю лідерів →

Як читати числа

arena.ai (раніше LMArena) показує користувачам дві анонімні відповіді на одне й те саме запитання та просить вибрати одну, а потім виводить рейтинг Elo на основі цих баталій. Він вимірює, яку відповідь люди віддають перевагу — а не об'єктивну здатність. Приємний стиль може перемогти, тоді як строга, але багатослівна відповідь може програти.

Голоси — це битви, які накопичила модель. Нещодавно додана модель має мало голосів і широкий довірчий інтервал, тому її рейтинг легко коливається — завжди читайте рейтинг разом з інтервалом ±.

Дошка агентів працює інакше, ніж решта: вона вимірює реальні сесії агентів, а не преференції сліпого голосування. Її головний показник, Net Improvement, є відсотковим приростом — не рейтингом Elo — тому його не можна порівнювати між дошками. arena.ai також повідомляє про п'ять додаткових вимірів (Confirmed Success, Steerability, Bash Recovery та інші) на повній дошці лідерів.

Дошка використання надходить з OpenRouter і враховує реальну частку API токенів — розробники голосують своїми гаманцями, що доповнює дошки суб'єктивних уподобань.

Мовні лідерборди походять з Artificial Analysis: TTS використовує Elo від Speech Arena на основі сліпого прослуховування; ASR використовує AA-WER v2, де нижче — краще; а нативний Speech-to-Speech використовує рівноваговий композит Big Bench Audio, Full Duplex Bench та τ-Voice, де вище — краще. Порівнюйте бали лише в межах одного лідерборду. Джерело: artificialanalysis.ai.

Дошка Intelligence Index походить від Artificial Analysis: вона зводить багато публічних бенчмарків в єдиний Intelligence Index від 0 до 100, вимірюючи об’єктивну здатність, а не суб’єктивне вподобання — природне доповнення до сліпого голосування людей від arena.ai. Джерело: artificialanalysis.ai.