एआई मॉडल लीडरबोर्ड

बहु-स्रोत AI रैंकिंग चैट, भाषण, TTS, ASR, कोड, छवि, वीडियो और एजेंटों के लिए — arena.ai, OpenRouter और Artificial Analysis से।

रैंकमॉडलवेंडरElo ?वोट ?
1MiniMaxminimax-h3MiniMax1489 ±713,020
2Bytedancedreamina-seedance-2.5-720pBytedance1484 ±122,912
3Bytedancedreamina-seedance-2.0-720pBytedance1478 ±8105,298
4Googlegemini-omni-flashGoogle1462 ±654,179
5SpaceXAIgrok-imagine-video-1.5-720pSpaceXAI1460 ±599,649
6Black Forest Labsflux-3-video-20260811Black Forest Labs1449 ±103,770
7Alibaba-ATHhappyhorse-1.0Alibaba-ATH1442 ±1070,772
8Alibabawan2.7-i2vAlibaba1427 ±557,878
9SpaceXAIgrok-imagine-video-720pSpaceXAI1415 ±5517,108
10Googleveo-3.1-audioGoogle1397 ±1125,156
11Googleveo-3.1-audio-1080pGoogle1390 ±953,179
12Googleveo-3.1-fast-audioGoogle1384 ±999,932
13SpaceXAIgrok-imagine-video-480pSpaceXAI1384 ±819,443
14Googleveo-3.1-fast-audio-1080pGoogle1371 ±1054,455
15Shengshuvidu-q3-proShengshu1362 ±936,723

स्रोत: arena.ai · अपडेटेड Aug 14, 2026 · PandaNpc अपडेटेड 29 अग॰ 2026, 06:00 UTCपूरा लीडरबोर्ड देखें →

इन नंबरों को कैसे पढ़ें

arena.ai (पूर्व में LMArena) उपयोगकर्ताओं को एक ही प्रॉम्प्ट के दो अज्ञात उत्तर दिखाता है और उन्हें एक चुनने के लिए कहता है, फिर उन युद्धों से Elo रेटिंग प्राप्त करता है। यह मापता है कि लोग कौन सा उत्तर पसंद करते हैं — वस्तुनिष्ठ क्षमता नहीं। एक आकर्षक शैली जीत सकती है, जबकि एक कठोर लेकिन शब्दबहुल उत्तर हार सकता है।

वोट वे लड़ाइयाँ हैं जो एक मॉडल ने संचित की हैं। नवसूचीबद्ध मॉडल के पास कम वोट और एक व्यापक आत्मविश्वास अंतराल होता है, इसलिए इसकी रैंक आसानी से बदलती है — रैंक को हमेशा ± अंतराल के साथ पढ़ें।

एजेंट बोर्ड बाकी बोर्डों से अलग काम करता है: यह ब्लाइंड-वोट प्राथमिकता के बजाय वास्तविक एजेंट सत्रों को मापता है। इसका मुख्य मीट्रिक, Net Improvement, एक प्रतिशत लाभ है — Elo रेटिंग नहीं — इसलिए इसकी तुलना बोर्डों के बीच नहीं की जा सकती। arena.ai पूरे लीडरबोर्ड पर पाँच और आयाम (Confirmed Success, Steerability, Bash Recovery और अन्य) भी रिपोर्ट करता है।

उपयोग बोर्ड OpenRouter से आता है और वास्तविक API token शेयर की गणना करता है — डेवलपर्स अपने वॉलेट से वोट कर रहे हैं, जो व्यक्तिपरक प्राथमिकता बोर्डों को पूरक करता है।

स्पीच बोर्ड Artificial Analysis से आते हैं: TTS ब्लाइंड-लिसनिंग Speech Arena Elo का उपयोग करता है; ASR AA-WER v2 का उपयोग करता है, जहाँ कम बेहतर है; और नेटिव Speech-to-Speech Big Bench Audio, Full Duplex Bench और τ-Voice के समान-भार वाले समग्र का उपयोग करता है, जहाँ अधिक बेहतर है। स्कोर की तुलना केवल उसी बोर्ड के भीतर करें। स्रोत: artificialanalysis.ai.

इंटेलिजेंस इंडेक्स बोर्ड आर्टिफिशियल एनालिसिस से आता है: यह कई सार्वजनिक बेंचमार्क को एक 0-100 इंटेलिजेंस इंडेक्स में संक्षिप्त करता है, जो व्यक्तिपरक प्राथमिकता के बजाय वस्तुनिष्ठ क्षमता को मापता है — यह arena.ai के मानव ब्लाइंड वोट का एक स्वाभाविक पूरक है। स्रोत: artificialanalysis.ai।