Papan Peringkat Model AI
Peringkat AI multi-sumber untuk chat, ucapan, TTS, ASR, kode, gambar, video, dan agen — dari arena.ai, OpenRouter, dan Artificial Analysis.
| Peringkat | Model | Vendor | Perbaikan Bersih ? | Sesi ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 (High) | Anthropic | 12.73% ±1.63 | 20,070 | 5.00 | 25.0 | 0.500 |
| 2 | Claude Opus 5 (Max) | Anthropic | 12.41% ±1.91 | 15,850 | 5.00 | 25.0 | 0.500 |
| 3 | Claude Fable 5 (High) | Anthropic | 11.62% ±1.63 | 32,981 | 10.0 | 50.0 | 1.00 |
| 4 | GPT 5.6 Sol (xHigh) | OpenAI | 10.31% ±1.45 | 26,960 | 2.00 | 10.0 | 0.200 |
| 5 | Claude Opus 4.8 (High) | Anthropic | 9.99% ±1.53 | 35,588 | 5.00 | 25.0 | 0.500 |
| 6 | Kimi K3 (Max) | Moonshot | 9.53% ±0.61 | 89,758 | 3.00 | 15.0 | 0.300 |
| 7 | GPT 5.5 (xHigh) | OpenAI | 8.56% ±0.97 | 48,549 | 5.00 | 30.0 | 0.500 |
| 8 | Claude Sonnet 5 (High) | Anthropic | 8.05% ±2.27 | 26,108 | 2.00 | 10.0 | 0.200 |
| 9 | Claude Opus 4.7 (High) | Anthropic | 7.27% ±1.26 | 36,563 | 5.00 | 25.0 | 0.500 |
| 10 | Claude Opus 4.7 | Anthropic | 7.18% ±1.28 | 37,099 | 5.00 | 25.0 | 0.500 |
Sumber: arena.ai · Diperbarui Aug 24, 2026 · PandaNpc Diperbarui 29 Agu 2026, 06.00 UTCLihat papan peringkat lengkap →
Cara Membaca Angka
arena.ai (sebelumnya LMArena) menampilkan dua jawaban anonim kepada pengguna untuk perintah yang sama dan meminta mereka memilih salah satu, kemudian memperoleh peringkat Elo dari pertarungan tersebut. Ini mengukur jawaban mana yang lebih disukai orang — bukan kemampuan objektif. Gaya yang disukai bisa menang, sementara jawaban yang teliti tetapi bertele-tele bisa kalah.
Votes adalah pertempuran yang telah dikumpulkan oleh sebuah model. Model yang baru terdaftar memiliki sedikit votes dan interval kepercayaan yang lebar, sehingga peringkatnya mudah berubah — selalu baca peringkat bersama dengan interval ±.
Papan Agent bekerja berbeda dari yang lain: papan ini mengukur sesi agen nyata, bukan preferensi suara buta. Metrik utamanya, Net Improvement, adalah kenaikan persentase — bukan peringkat Elo — sehingga tidak dapat dibandingkan antar papan. arena.ai juga melaporkan lima dimensi lagi (Confirmed Success, Steerability, Bash Recovery dan lainnya) di papan peringkat lengkap.
Papan penggunaan berasal dari OpenRouter dan menghitung pangsa token API nyata — pengembang memberikan suara dengan dompet mereka, yang melengkapi papan preferensi subjektif.
Papan peringkat speech berasal dari Artificial Analysis: TTS menggunakan Elo Speech Arena dengan pendengaran buta; ASR menggunakan AA-WER v2, di mana lebih rendah lebih baik; dan Speech-to-Speech native menggunakan komposit berbobot setara dari Big Bench Audio, Full Duplex Bench, dan τ-Voice, di mana lebih tinggi lebih baik. Bandingkan skor hanya dalam papan yang sama. Sumber: artificialanalysis.ai.
Papan Intelligence Index berasal dari Artificial Analysis: papan ini menyaring banyak tolok ukur publik menjadi satu Intelligence Index 0-100, mengukur kemampuan objektif daripada preferensi subjektif — pelengkap alami untuk vote buta manusia arena.ai. Sumber: artificialanalysis.ai.
