Papan Peringkat Model AI

Peringkat AI multi-sumber untuk chat, ucapan, TTS, ASR, kode, gambar, video, dan agen — dari arena.ai, OpenRouter, dan Artificial Analysis.

PeringkatModelVendorElo ?Suara ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Sumber: arena.ai · Diperbarui Aug 21, 2026 · PandaNpc Diperbarui 29 Agu 2026, 06.00 UTCLihat papan peringkat lengkap →

Cara Membaca Angka

arena.ai (sebelumnya LMArena) menampilkan dua jawaban anonim kepada pengguna untuk perintah yang sama dan meminta mereka memilih salah satu, kemudian memperoleh peringkat Elo dari pertarungan tersebut. Ini mengukur jawaban mana yang lebih disukai orang — bukan kemampuan objektif. Gaya yang disukai bisa menang, sementara jawaban yang teliti tetapi bertele-tele bisa kalah.

Votes adalah pertempuran yang telah dikumpulkan oleh sebuah model. Model yang baru terdaftar memiliki sedikit votes dan interval kepercayaan yang lebar, sehingga peringkatnya mudah berubah — selalu baca peringkat bersama dengan interval ±.

Papan Agent bekerja berbeda dari yang lain: papan ini mengukur sesi agen nyata, bukan preferensi suara buta. Metrik utamanya, Net Improvement, adalah kenaikan persentase — bukan peringkat Elo — sehingga tidak dapat dibandingkan antar papan. arena.ai juga melaporkan lima dimensi lagi (Confirmed Success, Steerability, Bash Recovery dan lainnya) di papan peringkat lengkap.

Papan penggunaan berasal dari OpenRouter dan menghitung pangsa token API nyata — pengembang memberikan suara dengan dompet mereka, yang melengkapi papan preferensi subjektif.

Papan peringkat speech berasal dari Artificial Analysis: TTS menggunakan Elo Speech Arena dengan pendengaran buta; ASR menggunakan AA-WER v2, di mana lebih rendah lebih baik; dan Speech-to-Speech native menggunakan komposit berbobot setara dari Big Bench Audio, Full Duplex Bench, dan τ-Voice, di mana lebih tinggi lebih baik. Bandingkan skor hanya dalam papan yang sama. Sumber: artificialanalysis.ai.

Papan Intelligence Index berasal dari Artificial Analysis: papan ini menyaring banyak tolok ukur publik menjadi satu Intelligence Index 0-100, mengukur kemampuan objektif daripada preferensi subjektif — pelengkap alami untuk vote buta manusia arena.ai. Sumber: artificialanalysis.ai.