AIモデルリーダーボード

チャット、音声、TTS、ASR、コード、画像、動画、エージェント向けのマルチソースAIランキング — arena.ai、OpenRouter、Artificial Analysis から。

順位モデルベンダーElo ?投票数 ?
1Bytedancedreamina-seedance-2.5-720pBytedance1411 ±27403
2MiniMaxminimax-h3MiniMax1388 ±24554
3Bytedancedreamina-seedance-2.0-720pBytedance1359 ±143,634
4Googlegemini-omni-flashGoogle1358 ±151,868
5Alibaba-ATHhappyhorse-1.0Alibaba-ATH1307 ±133,115
6SpaceXAIgrok-imagine-videoSpaceXAI1262 ±1013,281
7KlingAIkling-o3-proKlingAI1257 ±127,125
8KlingAIkling-o1-proKlingAI1200 ±1010,104
9Runwayrunway-gen4-alephRunway1183 ±89,817

ソース: arena.ai · 更新日 Aug 14, 2026 · PandaNpc 更新日 2026年8月29日 06:00 UTC完全なリーダーボードを見る →

数字の見方

arena.ai(旧LMArena)は、ユーザーに同じプロンプトに対する2つの匿名の回答を表示し、どちらかを選んでもらいます。その対戦からEloレーティングを算出します。これは、ユーザーがどちらの回答を好むかを測定するものであり、客観的な能力を測るものではありません。好まれるスタイルが勝つことがあり、厳密だが冗長な回答は負けることがあります。

投票数はモデルが蓄積したバトル数です。新しくリストされたモデルは投票数が少なく信頼区間が広いため、ランクが変動しやすくなります。常にランクを±区間と一緒に読んでください。

エージェントボードは他のボードとは異なる動作をします:ブラインド投票の選好ではなく、実際のエージェントセッションを測定します。その主要指標であるNet Improvementはパーセンテージの増加であり、Eloレーティングではないため、ボード間で比較できません。arena.aiは完全なリーダーボードで、さらに5つの次元(Confirmed Success、Steerability、Bash Recoveryなど)も報告しています。

利用状況ボードはOpenRouterから提供され、実際のAPIトークンシェアをカウントしています — 開発者がウォレットで投票しており、主観的な好みのボードを補完します。

スピーチボードはArtificial Analysisに由来します。TTSはブラインドリスニングのSpeech Arena Eloを使用し、ASRはAA-WER v2を使用します(低いほど優れています)。ネイティブSpeech-to-SpeechはBig Bench Audio、Full Duplex Bench、τ-Voiceの等加重複合スコアを使用します(高いほど優れています)。スコアは同じボード内でのみ比較してください。出典: artificialanalysis.ai

Intelligence IndexボードはArtificial Analysisから提供されています。多くの公開ベンチマークを0-100のIntelligence Indexに集約し、主観的な好みではなく客観的な能力を測定します。これはarena.aiの人間によるブラインド投票に対する自然な補完です。出典: artificialanalysis.ai。