Лідерборди AI моделей

Багатоджерельні рейтинги ШІ для чату, мовлення, TTS, ASR, коду, зображень, відео та агентів — від arena.ai, OpenRouter та Artificial Analysis.

МісцеМодельПостачальникElo ?Голоси ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1312 ±99,56210.050.01.00
2Alibabaqwen3.8-maxAlibaba1302 ±86,7432.006.000.250
3Anthropicclaude-opus-4-7-highAnthropic1301 ±721,1225.0025.00.500
4Anthropicclaude-opus-4-7Anthropic1299 ±721,4455.0025.00.500
5Anthropicclaude-opus-4-6-highAnthropic1299 ±720,8675.0025.00.500
6Metamuse-sparkMeta1294 ±95,582
7Anthropicclaude-opus-4-6Anthropic1293 ±725,1695.0025.00.500
8Metamuse-spark-1.2 (xHigh)Meta1292 ±151,8531.254.250.150
9Anthropicclaude-opus-5-highAnthropic1292 ±97,0495.0025.00.500
10Googlegemini-3-proGoogle1289 ±813,134
11Googlegemini-3.5-flash-highGoogle1286 ±97,5861.509.000.150
12Anthropicclaude-opus-4-8-highAnthropic1285 ±812,8945.0025.00.500
13Googlegemini-3.6-flash-highGoogle1285 ±123,1190.7503.750.075
14OpenAIgpt-5.5OpenAI1285 ±720,7275.0030.00.500
15Googlegemini-3.5-flash-mediumGoogle1285 ±97,5331.509.000.150

Джерело: arena.ai · Оновлено Aug 21, 2026 · PandaNpc Оновлено 29 серп. 2026 р., 06:00 UTCПереглянути повну таблицю лідерів →

Як читати числа

arena.ai (раніше LMArena) показує користувачам дві анонімні відповіді на одне й те саме запитання та просить вибрати одну, а потім виводить рейтинг Elo на основі цих баталій. Він вимірює, яку відповідь люди віддають перевагу — а не об'єктивну здатність. Приємний стиль може перемогти, тоді як строга, але багатослівна відповідь може програти.

Голоси — це битви, які накопичила модель. Нещодавно додана модель має мало голосів і широкий довірчий інтервал, тому її рейтинг легко коливається — завжди читайте рейтинг разом з інтервалом ±.

Дошка агентів працює інакше, ніж решта: вона вимірює реальні сесії агентів, а не преференції сліпого голосування. Її головний показник, Net Improvement, є відсотковим приростом — не рейтингом Elo — тому його не можна порівнювати між дошками. arena.ai також повідомляє про п'ять додаткових вимірів (Confirmed Success, Steerability, Bash Recovery та інші) на повній дошці лідерів.

Дошка використання надходить з OpenRouter і враховує реальну частку API токенів — розробники голосують своїми гаманцями, що доповнює дошки суб'єктивних уподобань.

Мовні лідерборди походять з Artificial Analysis: TTS використовує Elo від Speech Arena на основі сліпого прослуховування; ASR використовує AA-WER v2, де нижче — краще; а нативний Speech-to-Speech використовує рівноваговий композит Big Bench Audio, Full Duplex Bench та τ-Voice, де вище — краще. Порівнюйте бали лише в межах одного лідерборду. Джерело: artificialanalysis.ai.

Дошка Intelligence Index походить від Artificial Analysis: вона зводить багато публічних бенчмарків в єдиний Intelligence Index від 0 до 100, вимірюючи об’єктивну здатність, а не суб’єктивне вподобання — природне доповнення до сліпого голосування людей від arena.ai. Джерело: artificialanalysis.ai.