Classements des modèles d'IA

Classements IA multi-sources pour le chat, la parole, le TTS, l'ASR, le code, l'image, la vidéo et les agents — issus d'arena.ai, d'OpenRouter et d'Artificial Analysis.

RangModèleFournisseurElo ?Votes ?
1MiniMaxminimax-h3MiniMax1489 ±713,020
2Bytedancedreamina-seedance-2.5-720pBytedance1484 ±122,912
3Bytedancedreamina-seedance-2.0-720pBytedance1478 ±8105,298
4Googlegemini-omni-flashGoogle1462 ±654,179
5SpaceXAIgrok-imagine-video-1.5-720pSpaceXAI1460 ±599,649
6Black Forest Labsflux-3-video-20260811Black Forest Labs1449 ±103,770
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1442 ±1070,772
8Alibabawan2.7-i2vAlibaba1427 ±557,878
9SpaceXAIgrok-imagine-video-720pSpaceXAI1415 ±5517,108
10Googleveo-3.1-audioGoogle1397 ±1125,156
11Googleveo-3.1-audio-1080pGoogle1390 ±953,179
12Googleveo-3.1-fast-audioGoogle1384 ±999,932
13SpaceXAIgrok-imagine-video-480pSpaceXAI1384 ±819,443
14Googleveo-3.1-fast-audio-1080pGoogle1371 ±1054,455
15Shengshuvidu-q3-proShengshu1362 ±936,723

Source: arena.ai · Mis à jour Aug 14, 2026 · PandaNpc Mis à jour 29 août 2026, 06:00 UTCVoir le classement complet →

Lire ces chiffres

arena.ai (anciennement LMArena) montre aux utilisateurs deux réponses anonymes à une même requête et leur demande d'en choisir une, puis en déduit un score Elo à partir de ces confrontations. Il mesure quelle réponse les gens préfèrent — et non la capacité objective. Un style agréable peut gagner, tandis qu'une réponse rigoureuse mais verbeuse peut perdre.

Les votes sont les batailles accumulées par un modèle. Un modèle nouvellement listé a peu de votes et un large intervalle de confiance, donc son rang oscille facilement — lisez toujours le rang avec l'intervalle ±.

Le tableau Agent fonctionne différemment des autres : il mesure des sessions réelles d'agents plutôt qu'une préférence de vote à l'aveugle. Son indicateur principal, Net Improvement, est un gain en pourcentage — et non un score Elo — il ne peut donc pas être comparé entre les tableaux. arena.ai rapporte également cinq dimensions supplémentaires (Confirmed Success, Steerability, Bash Recovery et d'autres) sur le classement complet.

Le tableau d'utilisation provient d'OpenRouter et compte la part réelle de token API — les développeurs votent avec leur portefeuille, ce qui complète les tableaux de préférence subjective.

Les classements de parole proviennent d'Artificial Analysis : la TTS utilise l'Elo de Speech Arena en écoute à l'aveugle ; l'ASR utilise AA-WER v2, où un score plus bas est meilleur ; et le Speech-to-Speech natif utilise un composite à poids égal de Big Bench Audio, Full Duplex Bench et τ-Voice, où un score plus élevé est meilleur. Ne comparez les scores qu'au sein du même classement. Source : artificialanalysis.ai.

Le tableau de l'Intelligence Index provient d'Artificial Analysis : il résume de nombreux benchmarks publics en un seul Intelligence Index de 0 à 100, mesurant la capacité objective plutôt que la préférence subjective — un complément naturel au vote humain aveugle d'arena.ai. Source : artificialanalysis.ai.