Clasamente modele AI

Clasamente AI multi-sursă pentru chat, vorbire, TTS, ASR, cod, imagine, video și agenți — de la arena.ai, OpenRouter și Artificial Analysis.

RangModelFurnizorElo ?Voturi ?
1Googlegemini-omni-flashGoogle1512 ±1116,916
2Black Forest Labsflux-3-videoBlack Forest Labs1494 ±171,291
3Bytedancedreamina-seedance-2.0-720pBytedance1482 ±1049,058
4Bytedancedreamina-seedance-2.5-720pBytedance1477 ±191,337
5Metamuse-videoMeta1457 ±152,176
6MiniMaxminimax-h3MiniMax1453 ±133,081
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1428 ±1322,113
8OpenAIsora-2-proOpenAI1364 ±746,509
9Googleveo-3.1-audioGoogle1364 ±1413,743
10Googleveo-3.1-audio-1080pGoogle1363 ±1024,979
11Googleveo-3.1-fast-audioGoogle1361 ±1039,441
12Googleveo-3.1-fast-audio-1080pGoogle1358 ±1025,771
13Googleveo-3-fast-audioGoogle1347 ±1125,219
14SpaceXAIgrok-imagine-video-720pSpaceXAI1345 ±7154,827
15Alibabawan2.7-t2vAlibaba1344 ±917,769

Sursă: arena.ai · Actualizat Aug 14, 2026 · PandaNpc Actualizat 29 aug. 2026, 06:00 UTCVezi clasamentul complet →

Cum se citesc numerele

arena.ai (fost LMArena) le arată utilizatorilor două răspunsuri anonime la același prompt și îi roagă să aleagă unul, apoi derivă un rating Elo din aceste bătălii. Măsoară care răspuns este preferat de oameni — nu capacitatea obiectivă. Un stil plăcut poate câștiga, în timp ce un răspuns riguros dar verbose poate pierde.

Voturile sunt bătăliile acumulate de un model. Un model nou listat are puține voturi și un interval de încredere larg, astfel încât clasamentul său fluctuează ușor — citiți întotdeauna clasamentul împreună cu intervalul ±.

Tabloul Agent funcționează diferit față de celelalte: măsoară sesiuni reale de agent, nu preferințe oarbe prin vot. Indicatorul său principal, Net Improvement, este un procentaj de câștig — nu un rating Elo — deci nu poate fi comparat între tablouri. arena.ai raportează și cinci dimensiuni suplimentare (Confirmed Success, Steerability, Bash Recovery și altele) pe clasamentul complet.

Panoul de utilizare provine de la OpenRouter și numără cota reală de token API — dezvoltatorii votând cu portofelele lor, ceea ce completează panourile de preferințe subiective.

Clasamentele de vorbire provin de la Artificial Analysis: TTS folosește Speech Arena Elo cu ascultare în orb; ASR folosește AA-WER v2, unde o valoare mai mică este mai bună; iar Speech-to-Speech nativ folosește un compozit cu ponderi egale din Big Bench Audio, Full Duplex Bench și τ-Voice, unde o valoare mai mare este mai bună. Comparați scorurile doar în cadrul aceluiași clasament. Sursă: artificialanalysis.ai.

Clasamentul Intelligence Index provine de la Artificial Analysis: distilează multe repere publice într-un singur Intelligence Index de la 0 la 100, măsurând capacitatea obiectivă, nu preferința subiectivă — un complement natural pentru votul orb uman de pe arena.ai. Sursa: artificialanalysis.ai.