AI 模型榜单
多来源 AI 模型排行——覆盖对话、语音/TTS/ASR、代码、图片、视频与智能体,来源 arena.ai、OpenRouter 和 Artificial Analysis。
| 排名 | 模型 | 厂商 | Elo ? | 票数 ? | 输入 ? | 输出 | 缓存 ? |
|---|---|---|---|---|---|---|---|
| 1 | claude-opus-5-max | Anthropic | 1691 ±9 | 8,116 | 5.00 | 25.0 | 0.500 |
| 2 | kimi-k3-max | Moonshot | 1674 ±11 | 4,546 | 3.00 | 15.0 | 0.300 |
| 3 | qwen3.8-max | Alibaba | 1669 ±13 | 3,212 | 2.00 | 6.00 | 0.250 |
| 4 | claude-opus-5-high | Anthropic | 1663 ±8 | 8,659 | 5.00 | 25.0 | 0.500 |
| 5 | grok-4.6-high | SpaceXAI | 1629 ±17 | 1,523 | 2.00 | 6.00 | 0.500 |
| 6 | claude-fable-5 | Anthropic | 1626 ±8 | 8,382 | 10.0 | 50.0 | 1.00 |
| 7 | gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1619 ±8 | 9,499 | 2.00 | 10.0 | 0.200 |
| 8 | glm-5.3-max | Z.ai | 1599 ±15 | 1,916 | 1.40 | 4.40 | 0.260 |
| 9 | qwen3.8-27b | Alibaba | 1595 ±13 | 2,464 | 0.425 | 2.55 | 0.085 |
| 10 | gemini-3.7-flash-high | 1587 ±13 | 2,552 | 0.750 | 3.75 | 0.075 | |
| 11 | glm-5.2-max | Z.ai | 1582 ±8 | 8,775 | 1.19 | 3.74 | 0.221 |
| 12 | deepseek-v4-pro-high-20260813 | DeepSeek | 1582 ±12 | 2,869 | 0.660 | 1.98 | 0.022 |
| 13 | deepseek-v4-flash-high | DeepSeek | 1579 ±11 | 3,537 | 0.030 | 0.100 | 0.0070 |
| 14 | claude-opus-4-8-high | Anthropic | 1563 ±7 | 11,699 | 5.00 | 25.0 | 0.500 |
| 15 | claude-opus-4-7 | Anthropic | 1558 ±6 | 14,527 | 5.00 | 25.0 | 0.500 |
数据来源: arena.ai · 更新于 Aug 21, 2026 · PandaNpc 更新于 2026年8月29日 UTC 06:00查看完整榜单 →
指标怎么读
arena.ai(原 LMArena)让用户在不知道模型身份的情况下对同一问题的两份回答二选一,再用 Elo 算法推算等级分。它衡量的是「人更喜欢哪个」,不等同于客观能力——擅长讨人喜欢的风格会占优,而严谨但啰嗦的回答可能吃亏。
票数是该模型累计参与的对战场次。新模型刚上榜时票数少、置信区间宽,排名容易波动,看排名时应连同 ± 区间一起判断。
Agent 能力榜的口径与其他榜不同:它统计的是真实 Agent 会话,而非盲投偏好。主指标「净改进」是百分比形式的提升幅度,与 Elo 不在同一量纲,不能跨榜比较。arena.ai 还给出确认成功率、可引导性、Bash 恢复等五个维度,可在完整榜单查看。
用量热度榜来自 OpenRouter,统计的是真实 API 调用的 token 份额,代表开发者用脚投票的结果,与主观偏好榜互为补充。
语音榜来自 Artificial Analysis:TTS 采用人类盲听的 Speech Arena Elo;ASR 采用 AA-WER v2,数值越低越好;原生语音对语音榜则等权综合 Big Bench Audio、Full Duplex Bench 和 τ-Voice,数值越高越好。不同榜的分数不能横向比较。来源 artificialanalysis.ai。
智能指数榜来自 Artificial Analysis:把多项公开基准测试综合成一个 0-100 的 Intelligence Index,衡量的是客观能力而非主观偏好,正好与 arena.ai 的人类盲投互补。数据来源 artificialanalysis.ai。
