Рейтинги AI-моделей
Рейтинги ИИ для чата, речи, TTS, ASR, кода, изображений, видео и агентов из нескольких источников — от arena.ai, OpenRouter и Artificial Analysis.
| Место | Модель | Разработчик | Elo ? | Голоса ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-image-2 (medium) | OpenAI | 1462 ±4 | 212,326 | — | — | — |
| 2 | grok-imagine-image-2.0 (low) | SpaceXAI | 1439 ±8 | 5,936 | — | — | — |
| 3 | mai-image-2.6-preview | Microsoft AI | 1417 ±7 | 9,013 | — | — | — |
| 4 | muse-image | Meta | 1405 ±5 | 66,921 | — | — | — |
| 5 | mai-image-2.5 | Microsoft AI | 1399 ±4 | 173,251 | — | — | — |
| 6 | seedream-5.0-pro | Bytedance | 1395 ±4 | 129,749 | — | — | — |
| 7 | gemini-3-pro-image-2k (nano-banana-pro) | 1390 ±3 | 530,645 | — | — | — | |
| 8 | grok-imagine-image-quality (20260519) | SpaceXAI | 1390 ±6 | 35,596 | — | — | — |
| 9 | chatgpt-image-latest-high-fidelity (20251216) | OpenAI | 1390 ±3 | 520,974 | — | — | — |
| 10 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1387 ±4 | 132,009 | 0.500 | 3.00 | — | |
| 11 | gemini-3-pro-image-preview (nano-banana-pro) | 1385 ±3 | 518,482 | 2.00 | 12.0 | 0.200 | |
| 12 | reve-2.1 | Reve | 1375 ±6 | 19,103 | — | — | — |
| 13 | gpt-image-1.5-high-fidelity | OpenAI | 1371 ±3 | 543,542 | — | — | — |
| 14 | reve-2.0 | Reve | 1358 ±7 | 17,502 | — | — | — |
| 15 | uni-1.1-max | Luma AI | 1333 ±5 | 40,908 | — | — | — |
Источник: arena.ai · Обновлено Aug 25, 2026 · PandaNpc Обновлено 29 авг. 2026 г., 06:00 UTCПосмотреть полный рейтинг →
Как читать числа
arena.ai (ранее LMArena) показывает пользователям два анонимных ответа на один и тот же запрос и просит выбрать один, затем вычисляет рейтинг Elo на основе этих битв. Он измеряет, какой ответ люди предпочитают — а не объективные возможности. Приятный стиль может победить, в то время как строгий, но многословный ответ может проиграть.
Голоса — это сражения, которые модель накопила. У новой модели мало голосов и широкий доверительный интервал, поэтому её ранг легко колеблется — всегда читайте ранг вместе с интервалом ±.
Доска Agent работает иначе, чем остальные: она измеряет реальные сессии агентов, а не предпочтения по слепому голосованию. Её главный показатель, Net Improvement, — это процентный прирост, а не рейтинг Elo — поэтому его нельзя сравнивать между досками. arena.ai также сообщает о пяти дополнительных измерениях (Confirmed Success, Steerability, Bash Recovery и других) на полной таблице лидеров.
Таблица использования поступает от OpenRouter и учитывает реальную долю API токенов — разработчики голосуют своими кошельками, что дополняет таблицы субъективных предпочтений.
Речевые таблицы взяты из Artificial Analysis: TTS использует Elo рейтинг Speech Arena на основе слепого прослушивания; ASR использует AA-WER v2, где ниже лучше; а нативный Speech-to-Speech использует композит с равными весами из Big Bench Audio, Full Duplex Bench и τ-Voice, где выше лучше. Сравнивайте баллы только в пределах одной таблицы. Источник: artificialanalysis.ai.
Таблица Intelligence Index создана Artificial Analysis: она объединяет множество публичных бенчмарков в единый индекс Intelligence Index от 0 до 100, измеряющий объективные способности, а не субъективные предпочтения — естественное дополнение к человеческому слепому голосованию arena.ai. Источник: artificialanalysis.ai.
