Clasamente modele AI

Clasamente AI multi-sursă pentru chat, vorbire, TTS, ASR, cod, imagine, video și agenți — de la arena.ai, OpenRouter și Artificial Analysis.

RangModelFurnizorElo ?Voturi ?Input ?OutputCache ?
1Anthropicclaude-opus-5-maxAnthropic1691 ±98,1165.0025.00.500
2Moonshotkimi-k3-maxMoonshot1674 ±114,5463.0015.00.300
3Alibabaqwen3.8-maxAlibaba1669 ±133,2122.006.000.250
4Anthropicclaude-opus-5-highAnthropic1663 ±88,6595.0025.00.500
5SpaceXAIgrok-4.6-highSpaceXAI1629 ±171,5232.006.000.500
6Anthropicclaude-fable-5Anthropic1626 ±88,38210.050.01.00
7OpenAIgpt-5.6-sol-xhigh (codex-harness)OpenAI1619 ±89,4992.0010.00.200
8Z.aiglm-5.3-maxZ.ai1599 ±151,9161.404.400.260
9Alibabaqwen3.8-27bAlibaba1595 ±132,4640.4252.550.085
10Googlegemini-3.7-flash-highGoogle1587 ±132,5520.7503.750.075
11Z.aiglm-5.2-maxZ.ai1582 ±88,7751.193.740.221
12DeepSeekdeepseek-v4-pro-high-20260813DeepSeek1582 ±122,8690.6601.980.022
13DeepSeekdeepseek-v4-flash-highDeepSeek1579 ±113,5370.0300.1000.0070
14Anthropicclaude-opus-4-8-highAnthropic1563 ±711,6995.0025.00.500
15Anthropicclaude-opus-4-7Anthropic1558 ±614,5275.0025.00.500

Sursă: arena.ai · Actualizat Aug 21, 2026 · PandaNpc Actualizat 29 aug. 2026, 06:00 UTCVezi clasamentul complet →

Cum se citesc numerele

arena.ai (fost LMArena) le arată utilizatorilor două răspunsuri anonime la același prompt și îi roagă să aleagă unul, apoi derivă un rating Elo din aceste bătălii. Măsoară care răspuns este preferat de oameni — nu capacitatea obiectivă. Un stil plăcut poate câștiga, în timp ce un răspuns riguros dar verbose poate pierde.

Voturile sunt bătăliile acumulate de un model. Un model nou listat are puține voturi și un interval de încredere larg, astfel încât clasamentul său fluctuează ușor — citiți întotdeauna clasamentul împreună cu intervalul ±.

Tabloul Agent funcționează diferit față de celelalte: măsoară sesiuni reale de agent, nu preferințe oarbe prin vot. Indicatorul său principal, Net Improvement, este un procentaj de câștig — nu un rating Elo — deci nu poate fi comparat între tablouri. arena.ai raportează și cinci dimensiuni suplimentare (Confirmed Success, Steerability, Bash Recovery și altele) pe clasamentul complet.

Panoul de utilizare provine de la OpenRouter și numără cota reală de token API — dezvoltatorii votând cu portofelele lor, ceea ce completează panourile de preferințe subiective.

Clasamentele de vorbire provin de la Artificial Analysis: TTS folosește Speech Arena Elo cu ascultare în orb; ASR folosește AA-WER v2, unde o valoare mai mică este mai bună; iar Speech-to-Speech nativ folosește un compozit cu ponderi egale din Big Bench Audio, Full Duplex Bench și τ-Voice, unde o valoare mai mare este mai bună. Comparați scorurile doar în cadrul aceluiași clasament. Sursă: artificialanalysis.ai.

Clasamentul Intelligence Index provine de la Artificial Analysis: distilează multe repere publice într-un singur Intelligence Index de la 0 la 100, măsurând capacitatea obiectivă, nu preferința subiectivă — un complement natural pentru votul orb uman de pe arena.ai. Sursa: artificialanalysis.ai.