AI Model Liderlik Tabloları
Sohbet, konuşma, TTS, ASR, kod, görüntü, video ve ajanlar için çok kaynaklı AI sıralamaları — arena.ai, OpenRouter ve Artificial Analysis'tan.
| Sıra | Model | Satıcı | Elo ? | Oylar ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|---|
| 1 | gpt-image-2 (medium) | OpenAI | 1462 ±4 | 212,326 | — | — | — |
| 2 | grok-imagine-image-2.0 (low) | SpaceXAI | 1439 ±8 | 5,936 | — | — | — |
| 3 | mai-image-2.6-preview | Microsoft AI | 1417 ±7 | 9,013 | — | — | — |
| 4 | muse-image | Meta | 1405 ±5 | 66,921 | — | — | — |
| 5 | mai-image-2.5 | Microsoft AI | 1399 ±4 | 173,251 | — | — | — |
| 6 | seedream-5.0-pro | Bytedance | 1395 ±4 | 129,749 | — | — | — |
| 7 | gemini-3-pro-image-2k (nano-banana-pro) | 1390 ±3 | 530,645 | — | — | — | |
| 8 | grok-imagine-image-quality (20260519) | SpaceXAI | 1390 ±6 | 35,596 | — | — | — |
| 9 | chatgpt-image-latest-high-fidelity (20251216) | OpenAI | 1390 ±3 | 520,974 | — | — | — |
| 10 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1387 ±4 | 132,009 | 0.500 | 3.00 | — | |
| 11 | gemini-3-pro-image-preview (nano-banana-pro) | 1385 ±3 | 518,482 | 2.00 | 12.0 | 0.200 | |
| 12 | reve-2.1 | Reve | 1375 ±6 | 19,103 | — | — | — |
| 13 | gpt-image-1.5-high-fidelity | OpenAI | 1371 ±3 | 543,542 | — | — | — |
| 14 | reve-2.0 | Reve | 1358 ±7 | 17,502 | — | — | — |
| 15 | uni-1.1-max | Luma AI | 1333 ±5 | 40,908 | — | — | — |
Kaynak: arena.ai · Güncellendi Aug 25, 2026 · PandaNpc Güncellendi 29 Ağu 2026 06:00 UTCTam liderlik tablosunu görüntüle →
Bu sayılar nasıl okunur?
arena.ai (eski adıyla LMArena) kullanıcılara aynı istem için iki anonim yanıt gösterir ve birini seçmelerini ister, ardından bu savaşlardan bir Elo derecesi türetir. Hangi yanıtın insanlar tarafından tercih edildiğini ölçer — nesnel yeteneği değil. Sevimli bir tarz kazanabilirken, titiz ama ayrıntılı bir yanıt kaybedebilir.
Oylar, bir modelin biriktirdiği savaşlardır. Yeni listelenen bir modelin az oyu ve geniş bir güven aralığı vardır, bu nedenle sıralaması kolayca değişir — sıralamayı her zaman ± aralığıyla birlikte okuyun.
Ajan panosu diğerlerinden farklı çalışır: kör oylama tercihi yerine gerçek ajan oturumlarını ölçer. Başlık metriği Net Improvement, bir yüzdelik kazançtır — bir Elo derecesi değil — bu nedenle panolar arasında karşılaştırılamaz. arena.ai ayrıca tam liderlik tablosunda beş boyut daha raporlar (Confirmed Success, Steerability, Bash Recovery ve diğerleri).
Kullanım panosu OpenRouter'dan gelir ve gerçek API token payını sayar — geliştiricilerin cüzdanlarıyla oy kullanması, bu da subjektif tercih panolarını tamamlar.
Konuşma panoları Artificial Analysis'ten gelir: TTS, kör dinlemeli Speech Arena Elo kullanır; ASR, AA-WER v2 kullanır (daha düşük daha iyidir); ve yerel Speech-to-Speech, Big Bench Audio, Full Duplex Bench ve τ-Voice'in eşit ağırlıklı bir bileşimini kullanır (daha yüksek daha iyidir). Puanları yalnızca aynı pano içinde karşılaştırın. Kaynak: artificialanalysis.ai.
Intelligence Index panosu Artificial Analysis'tan gelir: birçok kamu kıyaslamasını tek bir 0-100 Intelligence Index'te özetler, öznel tercih yerine nesnel yeteneği ölçer — arena.ai'nin insan kör oylamasına doğal bir tamamlayıcıdır. Kaynak: artificialanalysis.ai.
