Clasamente modele AI

Clasamente AI multi-sursă pentru chat, vorbire, TTS, ASR, cod, imagine, video și agenți — de la arena.ai, OpenRouter și Artificial Analysis.

RangModelFurnizorElo ?Voturi ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Sursă: arena.ai · Actualizat Aug 25, 2026 · PandaNpc Actualizat 29 aug. 2026, 06:00 UTCVezi clasamentul complet →

Cum se citesc numerele

arena.ai (fost LMArena) le arată utilizatorilor două răspunsuri anonime la același prompt și îi roagă să aleagă unul, apoi derivă un rating Elo din aceste bătălii. Măsoară care răspuns este preferat de oameni — nu capacitatea obiectivă. Un stil plăcut poate câștiga, în timp ce un răspuns riguros dar verbose poate pierde.

Voturile sunt bătăliile acumulate de un model. Un model nou listat are puține voturi și un interval de încredere larg, astfel încât clasamentul său fluctuează ușor — citiți întotdeauna clasamentul împreună cu intervalul ±.

Tabloul Agent funcționează diferit față de celelalte: măsoară sesiuni reale de agent, nu preferințe oarbe prin vot. Indicatorul său principal, Net Improvement, este un procentaj de câștig — nu un rating Elo — deci nu poate fi comparat între tablouri. arena.ai raportează și cinci dimensiuni suplimentare (Confirmed Success, Steerability, Bash Recovery și altele) pe clasamentul complet.

Panoul de utilizare provine de la OpenRouter și numără cota reală de token API — dezvoltatorii votând cu portofelele lor, ceea ce completează panourile de preferințe subiective.

Clasamentele de vorbire provin de la Artificial Analysis: TTS folosește Speech Arena Elo cu ascultare în orb; ASR folosește AA-WER v2, unde o valoare mai mică este mai bună; iar Speech-to-Speech nativ folosește un compozit cu ponderi egale din Big Bench Audio, Full Duplex Bench și τ-Voice, unde o valoare mai mare este mai bună. Comparați scorurile doar în cadrul aceluiași clasament. Sursă: artificialanalysis.ai.

Clasamentul Intelligence Index provine de la Artificial Analysis: distilează multe repere publice într-un singur Intelligence Index de la 0 la 100, măsurând capacitatea obiectivă, nu preferința subiectivă — un complement natural pentru votul orb uman de pe arena.ai. Sursa: artificialanalysis.ai.