Clasamente modele AI

Clasamente AI multi-sursă pentru chat, vorbire, TTS, ASR, cod, imagine, video și agenți — de la arena.ai, OpenRouter și Artificial Analysis.

RangModelFurnizorElo ?Voturi ?Input ?OutputCache ?
1Anthropicclaude-fable-5Anthropic1508 ±524,33110.050.01.00
2Anthropicclaude-opus-4-6-highAnthropic1504 ±472,3595.0025.00.500
3Anthropicclaude-opus-4-7-highAnthropic1502 ±460,2035.0025.00.500
4Metamuse-spark-1.2 (xHigh)Meta1498 ±103,2571.254.250.150
5Anthropicclaude-opus-4-6Anthropic1497 ±376,3625.0025.00.500
6Anthropicclaude-opus-4-7Anthropic1494 ±461,3045.0025.00.500
7Anthropicclaude-opus-5-highAnthropic1493 ±527,6105.0025.00.500
8Metamuse-spark-1.1Meta1491 ±520,2421.254.250.150
9Googlegemini-3.7-flash-highGoogle1490 ±85,7180.7503.750.075
10Moonshotkimi-k3-maxMoonshot1489 ±615,0543.0015.00.300
11Metamuse-sparkMeta1488 ±613,584
12Anthropicclaude-opus-5-maxAnthropic1487 ±613,4035.0025.00.500
13Z.aiglm-5.3-maxZ.ai1487 ±103,7511.404.400.260
14Googlegemini-3.1-pro-previewGoogle1486 ±399,1822.0012.00.200
15Googlegemini-3-proGoogle1485 ±441,491

Sursă: arena.ai · Actualizat Aug 21, 2026 · PandaNpc Actualizat 29 aug. 2026, 06:00 UTCVezi clasamentul complet →

Cum se citesc numerele

arena.ai (fost LMArena) le arată utilizatorilor două răspunsuri anonime la același prompt și îi roagă să aleagă unul, apoi derivă un rating Elo din aceste bătălii. Măsoară care răspuns este preferat de oameni — nu capacitatea obiectivă. Un stil plăcut poate câștiga, în timp ce un răspuns riguros dar verbose poate pierde.

Voturile sunt bătăliile acumulate de un model. Un model nou listat are puține voturi și un interval de încredere larg, astfel încât clasamentul său fluctuează ușor — citiți întotdeauna clasamentul împreună cu intervalul ±.

Tabloul Agent funcționează diferit față de celelalte: măsoară sesiuni reale de agent, nu preferințe oarbe prin vot. Indicatorul său principal, Net Improvement, este un procentaj de câștig — nu un rating Elo — deci nu poate fi comparat între tablouri. arena.ai raportează și cinci dimensiuni suplimentare (Confirmed Success, Steerability, Bash Recovery și altele) pe clasamentul complet.

Panoul de utilizare provine de la OpenRouter și numără cota reală de token API — dezvoltatorii votând cu portofelele lor, ceea ce completează panourile de preferințe subiective.

Clasamentele de vorbire provin de la Artificial Analysis: TTS folosește Speech Arena Elo cu ascultare în orb; ASR folosește AA-WER v2, unde o valoare mai mică este mai bună; iar Speech-to-Speech nativ folosește un compozit cu ponderi egale din Big Bench Audio, Full Duplex Bench și τ-Voice, unde o valoare mai mare este mai bună. Comparați scorurile doar în cadrul aceluiași clasament. Sursă: artificialanalysis.ai.

Clasamentul Intelligence Index provine de la Artificial Analysis: distilează multe repere publice într-un singur Intelligence Index de la 0 la 100, măsurând capacitatea obiectivă, nu preferința subiectivă — un complement natural pentru votul orb uman de pe arena.ai. Sursa: artificialanalysis.ai.