Tablas de clasificación de modelos de IA

Rankings de IA de múltiples fuentes para chat, voz, TTS, ASR, código, imagen, video y agentes — de arena.ai, OpenRouter y Artificial Analysis.

PosiciónModeloProveedorSpeech Arena Elo ?
1CartesiaSonic 3.6Cartesia1288 ±17
2AlibabaQwen-Audio-3.0-TTS-PlusAlibaba1243 ±14
3SpeechifyAISimba 3.2SpeechifyAI1239 ±14
4InworldRealtime TTS-2 Flash - Research PreviewInworld1226 ±15
5VUI LabsLuna TTSVUI Labs1225 ±13
6BBreeze TTS 2BreezeBlue1221 ±17
7ElevenLabsv3 ConversationalElevenLabs1215 ±15
8GoogleGemini 3.1 Flash TTSGoogle1209 ±12
9StepFunStepAudio 2.5 TTSStepFun1206 ±14
10InworldRealtime TTS 1.5 MaxInworld1198 ±12
11CartesiaSonic 3.5Cartesia1197 ±12
12Smallest.aiLightning V3.1 Pro (Jul 2026)Smallest.ai1196 ±14
13InworldRealtime TTS-2 - Research PreviewInworld1186 ±12
14SonioxSoniox TTS Real-Time v2Soniox1182 ±11
15ElevenLabsEleven v3ElevenLabs1180 ±11

Fuente: Artificial Analysis · Actualizado Aug 29, 2026 · PandaNpc Actualizado 29 ago 2026, 06:00 UTCVer tabla completa →

Leer estos números

arena.ai (formerly LMArena) muestra a los usuarios dos respuestas anónimas a la misma pregunta y les pide que elijan una, luego deriva una calificación Elo de esas batallas. Mide qué respuesta prefiere la gente — no la capacidad objetiva. Un estilo agradable puede ganar, mientras que una respuesta rigurosa pero verbosa puede perder.

Los votos son las batallas que un modelo ha acumulado. Un modelo recién listado tiene pocos votos y un amplio intervalo de confianza, por lo que su rango varía fácilmente — siempre lea el rango junto con el intervalo ±.

El panel de Agent funciona de manera diferente al resto: mide sesiones reales de agentes en lugar de preferencia por voto ciego. Su métrica principal, Net Improvement, es un porcentaje de ganancia — no una calificación Elo — por lo que no se puede comparar entre paneles. arena.ai también reporta cinco dimensiones más (Confirmed Success, Steerability, Bash Recovery y otras) en el leaderboard completo.

El tablero de uso proviene de OpenRouter y cuenta la participación real de tokens de API — los desarrolladores votan con sus billeteras, lo que complementa los tableros de preferencia subjetiva.

Los paneles de voz provienen de Artificial Analysis: TTS usa el Elo de Speech Arena mediante escucha ciega; ASR usa AA-WER v2, donde un valor más bajo es mejor; y el Speech-to-Speech nativo usa un compuesto de igual ponderación de Big Bench Audio, Full Duplex Bench y τ-Voice, donde un valor más alto es mejor. Compara las puntuaciones solo dentro del mismo panel. Fuente: artificialanalysis.ai.

El tablero de Intelligence Index proviene de Artificial Analysis: destila muchos benchmarks públicos en un único Intelligence Index de 0 a 100, midiendo la capacidad objetiva en lugar de la preferencia subjetiva — un complemento natural para la votación ciega humana de arena.ai. Fuente: artificialanalysis.ai.