Classements des modèles d'IA
Classements IA multi-sources pour le chat, la parole, le TTS, l'ASR, le code, l'image, la vidéo et les agents — issus d'arena.ai, d'OpenRouter et d'Artificial Analysis.
| Rang | Modèle | Fournisseur | Elo ? | Votes ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | claude-opus-5-max | Anthropic | 1691 ±9 | 8,116 | 5.00 | 25.0 | 0.500 |
| 2 | kimi-k3-max | Moonshot | 1674 ±11 | 4,546 | 3.00 | 15.0 | 0.300 |
| 3 | qwen3.8-max | Alibaba | 1669 ±13 | 3,212 | 2.00 | 6.00 | 0.250 |
| 4 | claude-opus-5-high | Anthropic | 1663 ±8 | 8,659 | 5.00 | 25.0 | 0.500 |
| 5 | grok-4.6-high | SpaceXAI | 1629 ±17 | 1,523 | 2.00 | 6.00 | 0.500 |
| 6 | claude-fable-5 | Anthropic | 1626 ±8 | 8,382 | 10.0 | 50.0 | 1.00 |
| 7 | gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1619 ±8 | 9,499 | 2.00 | 10.0 | 0.200 |
| 8 | glm-5.3-max | Z.ai | 1599 ±15 | 1,916 | 1.40 | 4.40 | 0.260 |
| 9 | qwen3.8-27b | Alibaba | 1595 ±13 | 2,464 | 0.425 | 2.55 | 0.085 |
| 10 | gemini-3.7-flash-high | 1587 ±13 | 2,552 | 0.750 | 3.75 | 0.075 | |
| 11 | glm-5.2-max | Z.ai | 1582 ±8 | 8,775 | 1.19 | 3.74 | 0.221 |
| 12 | deepseek-v4-pro-high-20260813 | DeepSeek | 1582 ±12 | 2,869 | 0.660 | 1.98 | 0.022 |
| 13 | deepseek-v4-flash-high | DeepSeek | 1579 ±11 | 3,537 | 0.030 | 0.100 | 0.0070 |
| 14 | claude-opus-4-8-high | Anthropic | 1563 ±7 | 11,699 | 5.00 | 25.0 | 0.500 |
| 15 | claude-opus-4-7 | Anthropic | 1558 ±6 | 14,527 | 5.00 | 25.0 | 0.500 |
Source: arena.ai · Mis à jour Aug 21, 2026 · PandaNpc Mis à jour 29 août 2026, 06:00 UTCVoir le classement complet →
Lire ces chiffres
arena.ai (anciennement LMArena) montre aux utilisateurs deux réponses anonymes à une même requête et leur demande d'en choisir une, puis en déduit un score Elo à partir de ces confrontations. Il mesure quelle réponse les gens préfèrent — et non la capacité objective. Un style agréable peut gagner, tandis qu'une réponse rigoureuse mais verbeuse peut perdre.
Les votes sont les batailles accumulées par un modèle. Un modèle nouvellement listé a peu de votes et un large intervalle de confiance, donc son rang oscille facilement — lisez toujours le rang avec l'intervalle ±.
Le tableau Agent fonctionne différemment des autres : il mesure des sessions réelles d'agents plutôt qu'une préférence de vote à l'aveugle. Son indicateur principal, Net Improvement, est un gain en pourcentage — et non un score Elo — il ne peut donc pas être comparé entre les tableaux. arena.ai rapporte également cinq dimensions supplémentaires (Confirmed Success, Steerability, Bash Recovery et d'autres) sur le classement complet.
Le tableau d'utilisation provient d'OpenRouter et compte la part réelle de token API — les développeurs votent avec leur portefeuille, ce qui complète les tableaux de préférence subjective.
Les classements de parole proviennent d'Artificial Analysis : la TTS utilise l'Elo de Speech Arena en écoute à l'aveugle ; l'ASR utilise AA-WER v2, où un score plus bas est meilleur ; et le Speech-to-Speech natif utilise un composite à poids égal de Big Bench Audio, Full Duplex Bench et τ-Voice, où un score plus élevé est meilleur. Ne comparez les scores qu'au sein du même classement. Source : artificialanalysis.ai.
Le tableau de l'Intelligence Index provient d'Artificial Analysis : il résume de nombreux benchmarks publics en un seul Intelligence Index de 0 à 100, mesurant la capacité objective plutôt que la préférence subjective — un complément naturel au vote humain aveugle d'arena.ai. Source : artificialanalysis.ai.
