एआई मॉडल लीडरबोर्ड

बहु-स्रोत AI रैंकिंग चैट, भाषण, TTS, ASR, कोड, छवि, वीडियो और एजेंटों के लिए — arena.ai, OpenRouter और Artificial Analysis से।

रैंकमॉडलवेंडरElo ?वोट ?Input ?OutputCache ?
1OpenAIgpt-image-2 (medium)OpenAI1462 ±4212,326
2SpaceXAIgrok-imagine-image-2.0 (low)SpaceXAI1439 ±85,936
3Microsoft AImai-image-2.6-previewMicrosoft AI1417 ±79,013
4Metamuse-imageMeta1405 ±566,921
5Microsoft AImai-image-2.5Microsoft AI1399 ±4173,251
6Bytedanceseedream-5.0-proBytedance1395 ±4129,749
7Googlegemini-3-pro-image-2k (nano-banana-pro)Google1390 ±3530,645
8SpaceXAIgrok-imagine-image-quality (20260519)SpaceXAI1390 ±635,596
9OpenAIchatgpt-image-latest-high-fidelity (20251216)OpenAI1390 ±3520,974
10Googlegemini-3.1-flash-image (nano-banana-2) [web-search]Google1387 ±4132,0090.5003.00
11Googlegemini-3-pro-image-preview (nano-banana-pro)Google1385 ±3518,4822.0012.00.200
12Revereve-2.1Reve1375 ±619,103
13OpenAIgpt-image-1.5-high-fidelityOpenAI1371 ±3543,542
14Revereve-2.0Reve1358 ±717,502
15Luma AIuni-1.1-maxLuma AI1333 ±540,908

स्रोत: arena.ai · अपडेटेड Aug 25, 2026 · PandaNpc अपडेटेड 29 अग॰ 2026, 06:00 UTCपूरा लीडरबोर्ड देखें →

इन नंबरों को कैसे पढ़ें

arena.ai (पूर्व में LMArena) उपयोगकर्ताओं को एक ही प्रॉम्प्ट के दो अज्ञात उत्तर दिखाता है और उन्हें एक चुनने के लिए कहता है, फिर उन युद्धों से Elo रेटिंग प्राप्त करता है। यह मापता है कि लोग कौन सा उत्तर पसंद करते हैं — वस्तुनिष्ठ क्षमता नहीं। एक आकर्षक शैली जीत सकती है, जबकि एक कठोर लेकिन शब्दबहुल उत्तर हार सकता है।

वोट वे लड़ाइयाँ हैं जो एक मॉडल ने संचित की हैं। नवसूचीबद्ध मॉडल के पास कम वोट और एक व्यापक आत्मविश्वास अंतराल होता है, इसलिए इसकी रैंक आसानी से बदलती है — रैंक को हमेशा ± अंतराल के साथ पढ़ें।

एजेंट बोर्ड बाकी बोर्डों से अलग काम करता है: यह ब्लाइंड-वोट प्राथमिकता के बजाय वास्तविक एजेंट सत्रों को मापता है। इसका मुख्य मीट्रिक, Net Improvement, एक प्रतिशत लाभ है — Elo रेटिंग नहीं — इसलिए इसकी तुलना बोर्डों के बीच नहीं की जा सकती। arena.ai पूरे लीडरबोर्ड पर पाँच और आयाम (Confirmed Success, Steerability, Bash Recovery और अन्य) भी रिपोर्ट करता है।

उपयोग बोर्ड OpenRouter से आता है और वास्तविक API token शेयर की गणना करता है — डेवलपर्स अपने वॉलेट से वोट कर रहे हैं, जो व्यक्तिपरक प्राथमिकता बोर्डों को पूरक करता है।

स्पीच बोर्ड Artificial Analysis से आते हैं: TTS ब्लाइंड-लिसनिंग Speech Arena Elo का उपयोग करता है; ASR AA-WER v2 का उपयोग करता है, जहाँ कम बेहतर है; और नेटिव Speech-to-Speech Big Bench Audio, Full Duplex Bench और τ-Voice के समान-भार वाले समग्र का उपयोग करता है, जहाँ अधिक बेहतर है। स्कोर की तुलना केवल उसी बोर्ड के भीतर करें। स्रोत: artificialanalysis.ai.

इंटेलिजेंस इंडेक्स बोर्ड आर्टिफिशियल एनालिसिस से आता है: यह कई सार्वजनिक बेंचमार्क को एक 0-100 इंटेलिजेंस इंडेक्स में संक्षिप्त करता है, जो व्यक्तिपरक प्राथमिकता के बजाय वस्तुनिष्ठ क्षमता को मापता है — यह arena.ai के मानव ब्लाइंड वोट का एक स्वाभाविक पूरक है। स्रोत: artificialanalysis.ai।