Tablas de clasificación de modelos de IA

Rankings de IA de múltiples fuentes para chat, voz, TTS, ASR, código, imagen, video y agentes — de arena.ai, OpenRouter y Artificial Analysis.

PosiciónModeloProveedorElo ?Votos ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1508 ±524,33110.050.01.00
2Anthropicclaude-opus-4-6-highAnthropic1504 ±472,3595.0025.00.500
3Anthropicclaude-opus-4-7-highAnthropic1502 ±460,2035.0025.00.500
4Metamuse-spark-1.2 (xHigh)Meta1498 ±103,2571.254.250.150
5Anthropicclaude-opus-4-6Anthropic1497 ±376,3625.0025.00.500
6Anthropicclaude-opus-4-7Anthropic1494 ±461,3045.0025.00.500
7Anthropicclaude-opus-5-highAnthropic1493 ±527,6105.0025.00.500
8Metamuse-spark-1.1Meta1491 ±520,2421.254.250.150
9Googlegemini-3.7-flash-highGoogle1490 ±85,7180.7503.750.075
10Moonshotkimi-k3-maxMoonshot1489 ±615,0543.0015.00.300
11Metamuse-sparkMeta1488 ±613,584
12Anthropicclaude-opus-5-maxAnthropic1487 ±613,4035.0025.00.500
13Z.aiglm-5.3-maxZ.ai1487 ±103,7511.404.400.260
14Googlegemini-3.1-pro-previewGoogle1486 ±399,1822.0012.00.200
15Googlegemini-3-proGoogle1485 ±441,491

Fuente: arena.ai · Actualizado Aug 21, 2026 · PandaNpc Actualizado 29 ago 2026, 06:00 UTCVer tabla completa →

Leer estos números

arena.ai (formerly LMArena) muestra a los usuarios dos respuestas anónimas a la misma pregunta y les pide que elijan una, luego deriva una calificación Elo de esas batallas. Mide qué respuesta prefiere la gente — no la capacidad objetiva. Un estilo agradable puede ganar, mientras que una respuesta rigurosa pero verbosa puede perder.

Los votos son las batallas que un modelo ha acumulado. Un modelo recién listado tiene pocos votos y un amplio intervalo de confianza, por lo que su rango varía fácilmente — siempre lea el rango junto con el intervalo ±.

El panel de Agent funciona de manera diferente al resto: mide sesiones reales de agentes en lugar de preferencia por voto ciego. Su métrica principal, Net Improvement, es un porcentaje de ganancia — no una calificación Elo — por lo que no se puede comparar entre paneles. arena.ai también reporta cinco dimensiones más (Confirmed Success, Steerability, Bash Recovery y otras) en el leaderboard completo.

El tablero de uso proviene de OpenRouter y cuenta la participación real de tokens de API — los desarrolladores votan con sus billeteras, lo que complementa los tableros de preferencia subjetiva.

Los paneles de voz provienen de Artificial Analysis: TTS usa el Elo de Speech Arena mediante escucha ciega; ASR usa AA-WER v2, donde un valor más bajo es mejor; y el Speech-to-Speech nativo usa un compuesto de igual ponderación de Big Bench Audio, Full Duplex Bench y τ-Voice, donde un valor más alto es mejor. Compara las puntuaciones solo dentro del mismo panel. Fuente: artificialanalysis.ai.

El tablero de Intelligence Index proviene de Artificial Analysis: destila muchos benchmarks públicos en un único Intelligence Index de 0 a 100, midiendo la capacidad objetiva en lugar de la preferencia subjetiva — un complemento natural para la votación ciega humana de arena.ai. Fuente: artificialanalysis.ai.