AI 모델 리더보드
채팅, 음성, TTS, ASR, 코드, 이미지, 비디오 및 에이전트를 위한 다중 소스 AI 순위 — arena.ai, OpenRouter 및 Artificial Analysis 제공.
| 순위 | 모델 | 공급업체 | 점유율 % ? | Tokens ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-5.6-luna-20260709 | OpenAI | 11.9% | 1.7T | 0.200 | 1.20 | 0.020 |
| 2 | deepseek-v4-flash-20260731 | DeepSeek | 11.3% | 1.6T | 0.030 | 0.100 | 0.0070 |
| 3 | mimo-v2.5-20260422 | Xiaomi | 11.1% | 1.6T | 0.140 | 0.280 | 0.0028 |
| 4 | glm-5.3-flash-20260826 | Zhipu | 10.9% | 1.6T | 0.075 | 0.250 | 0.015 |
| 5 | hy3-20260706 | Tencent | 6.8% | 963.0B | 0.132 | 0.528 | 0.033 |
| 6 | nemotron-3-ultra-550b-a55b-20260604 | Nvidia | 5.3% | 750.2B | 0.500 | 2.20 | 0.100 |
| 7 | deepseek-v4-flash-20260423 | DeepSeek | 5% | 711.5B | 0.030 | 0.100 | 0.0070 |
| 8 | minimax-m3-20260531 | MiniMax | 4.2% | 605.1B | 0.300 | 1.20 | 0.060 |
| 9 | hy4-preview-20260827 | Tencent | 2.6% | 363.8B | 0.834 | 2.50 | 0.042 |
| 10 | gemini-3.7-flash-20260813 | 2.5% | 353.6B | 0.750 | 3.75 | 0.075 | |
| 11 | glm-5.2-20260616 | Zhipu | 2.4% | 338.1B | 1.19 | 3.74 | 0.221 |
| 12 | gpt-5.6-sol-20260709 | OpenAI | 1.7% | 248.2B | 2.00 | 10.0 | 0.200 |
| 13 | deepseek-v4-pro-20260423 | DeepSeek | 1.6% | 233.3B | 0.660 | 1.98 | 0.022 |
| 14 | kimi-k3-20260715 | Moonshot | 1.6% | 226.0B | 3.00 | 15.0 | 0.300 |
| 15 | claude-opus-5-20260723 | Anthropic | 1.5% | 220.7B | 5.00 | 25.0 | 0.500 |
출처: OpenRouter · 업데이트됨 2026-08-28 · PandaNpc 업데이트됨 2026년 8월 29일 06:00 UTC전체 리더보드 보기 →
숫자 읽는 법
arena.ai (이전 LMArena)는 사용자에게 동일한 프롬프트에 대한 두 개의 익명 답변을 보여주고 하나를 선택하도록 요청한 후, 해당 배틀에서 Elo 레이팅을 도출합니다. 이는 사람들이 어떤 답변을 선호하는지 측정하는 것이지 — 객관적인 능력을 측정하는 것이 아닙니다. 호감 가는 스타일이 승리할 수 있지만, 엄격하지만 장황한 답변은 패배할 수 있습니다.
투표는 모델이 축적한 배틀입니다. 새로 등록된 모델은 투표가 적고 신뢰 구간이 넓어 순위가 쉽게 변동합니다 — 항상 순위를 ± 구간과 함께 읽으세요.
에이전트 보드는 다른 보드와 다르게 작동합니다. 블라인드 투표 선호도가 아닌 실제 에이전트 세션을 측정합니다. 주요 지표인 Net Improvement는 백분율 증가치이며 Elo 평점이 아니므로 보드 간 비교가 불가능합니다. arena.ai는 전체 리더보드에서 다섯 가지 추가 차원(Confirmed Success, Steerability, Bash Recovery 등)도 보고합니다.
사용 보드는 OpenRouter에서 제공되며 실제 API token 점유율을 집계합니다 — 개발자들이 지갑으로 투표하는 방식으로, 주관적 선호도 보드를 보완합니다.
음성 보드는 Artificial Analysis에서 제공됩니다: TTS는 블라인드 청취 Speech Arena Elo를 사용하고, ASR은 낮을수록 좋은 AA-WER v2를 사용하며, 네이티브 Speech-to-Speech는 높을수록 좋은 Big Bench Audio, Full Duplex Bench 및 τ-Voice의 동일 가중치 복합 점수를 사용합니다. 점수는 동일한 보드 내에서만 비교하세요. 출처: artificialanalysis.ai.
Intelligence Index 보드는 Artificial Analysis에서 제공됩니다: 이는 많은 공개 벤치마크를 단일 0-100 Intelligence Index로 압축하여 주관적 선호도가 아닌 객관적 능력을 측정합니다 — 이는 arena.ai의 인간 블라인드 투표와 자연스러운 보완 관계에 있습니다. 출처: artificialanalysis.ai.
