AIモデルリーダーボード

チャット、音声、TTS、ASR、コード、画像、動画、エージェント向けのマルチソースAIランキング — arena.ai、OpenRouter、Artificial Analysis から。

順位モデルベンダーElo ?投票数 ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1312 ±99,56210.050.01.00
2Alibabaqwen3.8-maxAlibaba1302 ±86,7432.006.000.250
3Anthropicclaude-opus-4-7-highAnthropic1301 ±721,1225.0025.00.500
4Anthropicclaude-opus-4-7Anthropic1299 ±721,4455.0025.00.500
5Anthropicclaude-opus-4-6-highAnthropic1299 ±720,8675.0025.00.500
6Metamuse-sparkMeta1294 ±95,582
7Anthropicclaude-opus-4-6Anthropic1293 ±725,1695.0025.00.500
8Metamuse-spark-1.2 (xHigh)Meta1292 ±151,8531.254.250.150
9Anthropicclaude-opus-5-highAnthropic1292 ±97,0495.0025.00.500
10Googlegemini-3-proGoogle1289 ±813,134
11Googlegemini-3.5-flash-highGoogle1286 ±97,5861.509.000.150
12Anthropicclaude-opus-4-8-highAnthropic1285 ±812,8945.0025.00.500
13Googlegemini-3.6-flash-highGoogle1285 ±123,1190.7503.750.075
14OpenAIgpt-5.5OpenAI1285 ±720,7275.0030.00.500
15Googlegemini-3.5-flash-mediumGoogle1285 ±97,5331.509.000.150

ソース: arena.ai · 更新日 Aug 21, 2026 · PandaNpc 更新日 2026年8月29日 06:00 UTC完全なリーダーボードを見る →

数字の見方

arena.ai(旧LMArena)は、ユーザーに同じプロンプトに対する2つの匿名の回答を表示し、どちらかを選んでもらいます。その対戦からEloレーティングを算出します。これは、ユーザーがどちらの回答を好むかを測定するものであり、客観的な能力を測るものではありません。好まれるスタイルが勝つことがあり、厳密だが冗長な回答は負けることがあります。

投票数はモデルが蓄積したバトル数です。新しくリストされたモデルは投票数が少なく信頼区間が広いため、ランクが変動しやすくなります。常にランクを±区間と一緒に読んでください。

エージェントボードは他のボードとは異なる動作をします:ブラインド投票の選好ではなく、実際のエージェントセッションを測定します。その主要指標であるNet Improvementはパーセンテージの増加であり、Eloレーティングではないため、ボード間で比較できません。arena.aiは完全なリーダーボードで、さらに5つの次元(Confirmed Success、Steerability、Bash Recoveryなど)も報告しています。

利用状況ボードはOpenRouterから提供され、実際のAPIトークンシェアをカウントしています — 開発者がウォレットで投票しており、主観的な好みのボードを補完します。

スピーチボードはArtificial Analysisに由来します。TTSはブラインドリスニングのSpeech Arena Eloを使用し、ASRはAA-WER v2を使用します(低いほど優れています)。ネイティブSpeech-to-SpeechはBig Bench Audio、Full Duplex Bench、τ-Voiceの等加重複合スコアを使用します(高いほど優れています)。スコアは同じボード内でのみ比較してください。出典: artificialanalysis.ai

Intelligence IndexボードはArtificial Analysisから提供されています。多くの公開ベンチマークを0-100のIntelligence Indexに集約し、主観的な好みではなく客観的な能力を測定します。これはarena.aiの人間によるブラインド投票に対する自然な補完です。出典: artificialanalysis.ai。