AI Model Liderlik Tabloları

Sohbet, konuşma, TTS, ASR, kod, görüntü, video ve ajanlar için çok kaynaklı AI sıralamaları — arena.ai, OpenRouter ve Artificial Analysis'tan.

SıraModelSatıcıElo ?Oylar ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

Kaynak: arena.ai · Güncellendi Aug 25, 2026 · PandaNpc Güncellendi 29 Ağu 2026 06:00 UTCTam liderlik tablosunu görüntüle →

Bu sayılar nasıl okunur?

arena.ai (eski adıyla LMArena) kullanıcılara aynı istem için iki anonim yanıt gösterir ve birini seçmelerini ister, ardından bu savaşlardan bir Elo derecesi türetir. Hangi yanıtın insanlar tarafından tercih edildiğini ölçer — nesnel yeteneği değil. Sevimli bir tarz kazanabilirken, titiz ama ayrıntılı bir yanıt kaybedebilir.

Oylar, bir modelin biriktirdiği savaşlardır. Yeni listelenen bir modelin az oyu ve geniş bir güven aralığı vardır, bu nedenle sıralaması kolayca değişir — sıralamayı her zaman ± aralığıyla birlikte okuyun.

Ajan panosu diğerlerinden farklı çalışır: kör oylama tercihi yerine gerçek ajan oturumlarını ölçer. Başlık metriği Net Improvement, bir yüzdelik kazançtır — bir Elo derecesi değil — bu nedenle panolar arasında karşılaştırılamaz. arena.ai ayrıca tam liderlik tablosunda beş boyut daha raporlar (Confirmed Success, Steerability, Bash Recovery ve diğerleri).

Kullanım panosu OpenRouter'dan gelir ve gerçek API token payını sayar — geliştiricilerin cüzdanlarıyla oy kullanması, bu da subjektif tercih panolarını tamamlar.

Konuşma panoları Artificial Analysis'ten gelir: TTS, kör dinlemeli Speech Arena Elo kullanır; ASR, AA-WER v2 kullanır (daha düşük daha iyidir); ve yerel Speech-to-Speech, Big Bench Audio, Full Duplex Bench ve τ-Voice'in eşit ağırlıklı bir bileşimini kullanır (daha yüksek daha iyidir). Puanları yalnızca aynı pano içinde karşılaştırın. Kaynak: artificialanalysis.ai.

Intelligence Index panosu Artificial Analysis'tan gelir: birçok kamu kıyaslamasını tek bir 0-100 Intelligence Index'te özetler, öznel tercih yerine nesnel yeteneği ölçer — arena.ai'nin insan kör oylamasına doğal bir tamamlayıcıdır. Kaynak: artificialanalysis.ai.