AIモデルリーダーボード
チャット、音声、TTS、ASR、コード、画像、動画、エージェント向けのマルチソースAIランキング — arena.ai、OpenRouter、Artificial Analysis から。
| 順位 | モデル | ベンダー | Elo ? | 投票数 ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-image-2 (medium) | OpenAI | 1382 ±4 | 75,014 | — | — | — |
| 2 | mai-image-2.6-preview | Microsoft AI | 1331 ±8 | 6,418 | — | — | — |
| 3 | grok-imagine-image-2.0 (low) | SpaceXAI | 1316 ±12 | 2,675 | — | — | — |
| 4 | reve-2.1 | Reve | 1302 ±8 | 7,580 | — | — | — |
| 5 | muse-image | Meta | 1281 ±6 | 22,691 | — | — | — |
| 6 | reve-2.0 | Reve | 1270 ±6 | 14,631 | — | — | — |
| 7 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1263 ±5 | 36,392 | 0.500 | 3.00 | — | |
| 8 | seedream-5.0-pro | Bytedance | 1258 ±5 | 48,174 | — | — | — |
| 9 | qwen-image-3.0-pro | Alibaba | 1255 ±7 | 10,927 | — | — | — |
| 10 | mai-image-2.5 | Microsoft AI | 1254 ±4 | 56,737 | — | — | — |
| 11 | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1251 ±6 | 16,381 | 0.250 | 1.50 | — | |
| 12 | gemini-3-pro-image-2k (nano-banana-pro) | 1245 ±3 | 146,806 | — | — | — | |
| 13 | gpt-image-1.5-high-fidelity | OpenAI | 1239 ±3 | 148,079 | — | — | — |
| 14 | gemini-3-pro-image-preview (nano-banana-pro) | 1232 ±5 | 82,738 | 2.00 | 12.0 | 0.200 | |
| 15 | ideogram-4.0-quality | Ideogram | 1204 ±5 | 36,647 | — | — | — |
ソース: arena.ai · 更新日 Aug 25, 2026 · PandaNpc 更新日 2026年8月29日 06:00 UTC完全なリーダーボードを見る →
数字の見方
arena.ai(旧LMArena)は、ユーザーに同じプロンプトに対する2つの匿名の回答を表示し、どちらかを選んでもらいます。その対戦からEloレーティングを算出します。これは、ユーザーがどちらの回答を好むかを測定するものであり、客観的な能力を測るものではありません。好まれるスタイルが勝つことがあり、厳密だが冗長な回答は負けることがあります。
投票数はモデルが蓄積したバトル数です。新しくリストされたモデルは投票数が少なく信頼区間が広いため、ランクが変動しやすくなります。常にランクを±区間と一緒に読んでください。
エージェントボードは他のボードとは異なる動作をします:ブラインド投票の選好ではなく、実際のエージェントセッションを測定します。その主要指標であるNet Improvementはパーセンテージの増加であり、Eloレーティングではないため、ボード間で比較できません。arena.aiは完全なリーダーボードで、さらに5つの次元(Confirmed Success、Steerability、Bash Recoveryなど)も報告しています。
利用状況ボードはOpenRouterから提供され、実際のAPIトークンシェアをカウントしています — 開発者がウォレットで投票しており、主観的な好みのボードを補完します。
スピーチボードはArtificial Analysisに由来します。TTSはブラインドリスニングのSpeech Arena Eloを使用し、ASRはAA-WER v2を使用します(低いほど優れています)。ネイティブSpeech-to-SpeechはBig Bench Audio、Full Duplex Bench、τ-Voiceの等加重複合スコアを使用します(高いほど優れています)。スコアは同じボード内でのみ比較してください。出典: artificialanalysis.ai
Intelligence IndexボードはArtificial Analysisから提供されています。多くの公開ベンチマークを0-100のIntelligence Indexに集約し、主観的な好みではなく客観的な能力を測定します。これはarena.aiの人間によるブラインド投票に対する自然な補完です。出典: artificialanalysis.ai。
