AI Model Liderlik Tabloları

Sohbet, konuşma, TTS, ASR, kod, görüntü, video ve ajanlar için çok kaynaklı AI sıralamaları — arena.ai, OpenRouter ve Artificial Analysis'tan.

SıraModelSatıcıElo ?Oylar ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1382 ±475,014
2Microsoft AImai-image-2.6-previewMicrosoft AI1331 ±86,418
3SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1316 ±122,675
4Revereve-2.1Reve1302 ±87,580
5Metamuse-imageMeta1281 ±622,691
6Revereve-2.0Reve1270 ±614,631
7Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1263 ±536,3920.5003.00
8Bytedanceseedream-5.0-proBytedance1258 ±548,174
9Alibabaqwen-image-3.0-proAlibaba1255 ±710,927
10Microsoft AImai-image-2.5Microsoft AI1254 ±456,737
11Googlegemini-3.1-flash-lite-image (nano-banana-2-lite)Google1251 ±616,3810.2501.50
12Googlegemini-3-pro-image-2k (nano-banana-pro)Google1245 ±3146,806
13OpenAIgpt-image-1.5-high-fidelityOpenAI1239 ±3148,079
14Googlegemini-3-pro-image-preview (nano-banana-pro)Google1232 ±582,7382.0012.00.200
15Ideogramideogram-4.0-qualityIdeogram1204 ±536,647

Kaynak: arena.ai · Güncellendi Aug 25, 2026 · PandaNpc Güncellendi 29 Ağu 2026 06:00 UTCTam liderlik tablosunu görüntüle →

Bu sayılar nasıl okunur?

arena.ai (eski adıyla LMArena) kullanıcılara aynı istem için iki anonim yanıt gösterir ve birini seçmelerini ister, ardından bu savaşlardan bir Elo derecesi türetir. Hangi yanıtın insanlar tarafından tercih edildiğini ölçer — nesnel yeteneği değil. Sevimli bir tarz kazanabilirken, titiz ama ayrıntılı bir yanıt kaybedebilir.

Oylar, bir modelin biriktirdiği savaşlardır. Yeni listelenen bir modelin az oyu ve geniş bir güven aralığı vardır, bu nedenle sıralaması kolayca değişir — sıralamayı her zaman ± aralığıyla birlikte okuyun.

Ajan panosu diğerlerinden farklı çalışır: kör oylama tercihi yerine gerçek ajan oturumlarını ölçer. Başlık metriği Net Improvement, bir yüzdelik kazançtır — bir Elo derecesi değil — bu nedenle panolar arasında karşılaştırılamaz. arena.ai ayrıca tam liderlik tablosunda beş boyut daha raporlar (Confirmed Success, Steerability, Bash Recovery ve diğerleri).

Kullanım panosu OpenRouter'dan gelir ve gerçek API token payını sayar — geliştiricilerin cüzdanlarıyla oy kullanması, bu da subjektif tercih panolarını tamamlar.

Konuşma panoları Artificial Analysis'ten gelir: TTS, kör dinlemeli Speech Arena Elo kullanır; ASR, AA-WER v2 kullanır (daha düşük daha iyidir); ve yerel Speech-to-Speech, Big Bench Audio, Full Duplex Bench ve τ-Voice'in eşit ağırlıklı bir bileşimini kullanır (daha yüksek daha iyidir). Puanları yalnızca aynı pano içinde karşılaştırın. Kaynak: artificialanalysis.ai.

Intelligence Index panosu Artificial Analysis'tan gelir: birçok kamu kıyaslamasını tek bir 0-100 Intelligence Index'te özetler, öznel tercih yerine nesnel yeteneği ölçer — arena.ai'nin insan kör oylamasına doğal bir tamamlayıcıdır. Kaynak: artificialanalysis.ai.