AIモデルリーダーボード

チャット、音声、TTS、ASR、コード、画像、動画、エージェント向けのマルチソースAIランキング — arena.ai、OpenRouter、Artificial Analysis から。

順位モデルベンダーAA-WER ↓ ?
1AlibabaFun-Realtime-ASR-previewAlibaba1.73%
2ElevenLabsScribe v2, ElevenLabsElevenLabs2.18%
3Microsoft AIMAI-Transcribe-1.5Microsoft AI2.38%
4Smallest.aiSmallest AI Pulse ProSmallest.ai2.43%
5GoogleGemini 3.5 TranscribeGoogle2.6%
6MistralVoxtral Small, MistralMistral2.77%
7GoogleGemini 3.1 Pro Preview (High)Google2.82%
8AssemblyAIUniversal-3.5 Pro, AssemblyAIAssemblyAI3.02%
9GladiaSolaria-3, GladiaGladia3.23%
10OpenAIGPT Transcribe, OpenAIOpenAI3.31%
11Reson8Resonant-1Reson83.39%
12Thinking MachinesInkling (256K), Thinking MachinesThinking Machines3.47%
13AlibabaQwen3.5 Omni PlusAlibaba3.55%
14GoogleGemini 3.1 Pro Preview (Low)Google3.58%
15MistralVoxtral Mini Transcribe 2, MistralMistral3.59%

ソース: Artificial Analysis · 更新日 Aug 29, 2026 · PandaNpc 更新日 2026年8月29日 06:00 UTC完全なリーダーボードを見る →

数字の見方

arena.ai(旧LMArena)は、ユーザーに同じプロンプトに対する2つの匿名の回答を表示し、どちらかを選んでもらいます。その対戦からEloレーティングを算出します。これは、ユーザーがどちらの回答を好むかを測定するものであり、客観的な能力を測るものではありません。好まれるスタイルが勝つことがあり、厳密だが冗長な回答は負けることがあります。

投票数はモデルが蓄積したバトル数です。新しくリストされたモデルは投票数が少なく信頼区間が広いため、ランクが変動しやすくなります。常にランクを±区間と一緒に読んでください。

エージェントボードは他のボードとは異なる動作をします:ブラインド投票の選好ではなく、実際のエージェントセッションを測定します。その主要指標であるNet Improvementはパーセンテージの増加であり、Eloレーティングではないため、ボード間で比較できません。arena.aiは完全なリーダーボードで、さらに5つの次元(Confirmed Success、Steerability、Bash Recoveryなど)も報告しています。

利用状況ボードはOpenRouterから提供され、実際のAPIトークンシェアをカウントしています — 開発者がウォレットで投票しており、主観的な好みのボードを補完します。

スピーチボードはArtificial Analysisに由来します。TTSはブラインドリスニングのSpeech Arena Eloを使用し、ASRはAA-WER v2を使用します(低いほど優れています)。ネイティブSpeech-to-SpeechはBig Bench Audio、Full Duplex Bench、τ-Voiceの等加重複合スコアを使用します(高いほど優れています)。スコアは同じボード内でのみ比較してください。出典: artificialanalysis.ai

Intelligence IndexボードはArtificial Analysisから提供されています。多くの公開ベンチマークを0-100のIntelligence Indexに集約し、主観的な好みではなく客観的な能力を測定します。これはarena.aiの人間によるブラインド投票に対する自然な補完です。出典: artificialanalysis.ai。