Bảng xếp hạng mô hình AI

Xếp hạng AI đa nguồn cho chat, giọng nói, TTS, ASR, code, hình ảnh, video và agent — từ arena.ai, OpenRouter và Artificial Analysis.

HạngMô hìnhNhà cung cấpSpeech Arena Elo ?
1CartesiaSonic 3.6Cartesia1288 ±17
2AlibabaQwen-Audio-3.0-TTS-PlusAlibaba1243 ±14
3SpeechifyAISimba 3.2SpeechifyAI1239 ±14
4InworldRealtime TTS-2 Flash - Research PreviewInworld1226 ±15
5VUI LabsLuna TTSVUI Labs1225 ±13
6BBreeze TTS 2BreezeBlue1221 ±17
7ElevenLabsv3 ConversationalElevenLabs1215 ±15
8GoogleGemini 3.1 Flash TTSGoogle1209 ±12
9StepFunStepAudio 2.5 TTSStepFun1206 ±14
10InworldRealtime TTS 1.5 MaxInworld1198 ±12
11CartesiaSonic 3.5Cartesia1197 ±12
12Smallest.aiLightning V3.1 Pro (Jul 2026)Smallest.ai1196 ±14
13InworldRealtime TTS-2 - Research PreviewInworld1186 ±12
14SonioxSoniox TTS Real-Time v2Soniox1182 ±11
15ElevenLabsEleven v3ElevenLabs1180 ±11

Nguồn: Artificial Analysis · Đã cập nhật Aug 29, 2026 · PandaNpc Đã cập nhật 06:00 UTC 29 thg 8, 2026Xem bảng xếp hạng đầy đủ →

Cách đọc số

arena.ai (trước đây là LMArena) hiển thị cho người dùng hai câu trả lời ẩn danh cho cùng một prompt và yêu cầu họ chọn một, sau đó tính điểm Elo từ những cuộc đối đầu đó. Nó đo lường câu trả lời mà mọi người ưa thích — không phải năng lực khách quan. Một phong cách dễ mến có thể thắng, trong khi một câu trả lời chặt chẽ nhưng dài dòng có thể thua.

Phiếu bầu là các trận đấu mà một mô hình đã tích lũy. Một mô hình mới được liệt kê có ít phiếu bầu và khoảng tin cậy rộng, vì vậy thứ hạng của nó dễ dao động — hãy luôn đọc thứ hạng cùng với khoảng ±.

Bảng Agent hoạt động khác với các bảng còn lại: nó đo lường các phiên agent thực tế thay vì so sánh ưu tiên mù. Chỉ số chính của nó, Net Improvement, là tỷ lệ phần trăm tăng — không phải xếp hạng Elo — vì vậy không thể so sánh giữa các bảng. arena.ai cũng báo cáo thêm năm khía cạnh (Confirmed Success, Steerability, Bash Recovery và các chỉ số khác) trên bảng xếp hạng đầy đủ.

Bảng sử dụng đến từ OpenRouter và đếm thị phần token API thực — các nhà phát triển bỏ phiếu bằng ví tiền của họ, điều này bổ sung cho các bảng ưu tiên chủ quan.

Các bảng xếp hạng giọng nói đến từ Artificial Analysis: TTS sử dụng Speech Arena Elo với phương pháp nghe mù; ASR sử dụng AA-WER v2, trong đó điểm thấp hơn là tốt hơn; và Speech-to-Speech gốc sử dụng tổng hợp trọng số bằng nhau của Big Bench Audio, Full Duplex Bench và τ-Voice, trong đó điểm cao hơn là tốt hơn. Chỉ so sánh điểm số trong cùng một bảng xếp hạng. Nguồn: artificialanalysis.ai.

Bảng Intelligence Index đến từ Artificial Analysis: nó tổng hợp nhiều benchmark công khai thành một chỉ số Intelligence Index duy nhất từ 0-100, đo lường năng lực khách quan thay vì sở thích chủ quan — một sự bổ sung tự nhiên cho bình chọn mù của con người trên arena.ai. Nguồn: artificialanalysis.ai.