एआई मॉडल लीडरबोर्ड

बहु-स्रोत AI रैंकिंग चैट, भाषण, TTS, ASR, कोड, छवि, वीडियो और एजेंटों के लिए — arena.ai, OpenRouter और Artificial Analysis से।

रैंकमॉडलवेंडरElo ?वोट ?Input ?OutputCache ?
1OpenAIgpt-5.6-sol-xhighOpenAI1257 ±729,6632.0010.00.200
2Anthropicclaude-opus-4-6-searchAnthropic1253 ±5134,6995.0025.00.500
3OpenAIgpt-5.5-searchOpenAI1242 ±589,8735.0030.00.500
4Anthropicclaude-opus-4-7Anthropic1233 ±591,3945.0025.00.500
5Anthropicclaude-fable-5Anthropic1230 ±841,79510.050.01.00
6Baiduernie-5.1Baidu1227 ±103,788
7Anthropicclaude-sonnet-4-6-searchAnthropic1221 ±5134,9053.0015.00.300
8SpaceXAIgrok-4.5SpaceXAI1213 ±731,5052.006.000.300
9Googlegemini-3.1-pro-groundingGoogle1210 ±5113,2822.0012.00.200
10Googlegemini-3-pro-groundingGoogle1207 ±637,024
11OpenAIgpt-5.2-searchOpenAI1207 ±652,7121.7514.00.175
12Anthropicclaude-opus-4-8Anthropic1204 ±670,9985.0025.00.500
13SpaceXAIgrok-4.20-multi-agent-beta-0309SpaceXAI1204 ±5109,5531.252.500.200
14OpenAIgpt-5.1-searchOpenAI1199 ±559,9091.2510.00.125
15Googlegemini-3-flash-groundingGoogle1198 ±5149,3340.5003.000.050

स्रोत: arena.ai · अपडेटेड Aug 24, 2026 · PandaNpc अपडेटेड 29 अग॰ 2026, 06:00 UTCपूरा लीडरबोर्ड देखें →

इन नंबरों को कैसे पढ़ें

arena.ai (पूर्व में LMArena) उपयोगकर्ताओं को एक ही प्रॉम्प्ट के दो अज्ञात उत्तर दिखाता है और उन्हें एक चुनने के लिए कहता है, फिर उन युद्धों से Elo रेटिंग प्राप्त करता है। यह मापता है कि लोग कौन सा उत्तर पसंद करते हैं — वस्तुनिष्ठ क्षमता नहीं। एक आकर्षक शैली जीत सकती है, जबकि एक कठोर लेकिन शब्दबहुल उत्तर हार सकता है।

वोट वे लड़ाइयाँ हैं जो एक मॉडल ने संचित की हैं। नवसूचीबद्ध मॉडल के पास कम वोट और एक व्यापक आत्मविश्वास अंतराल होता है, इसलिए इसकी रैंक आसानी से बदलती है — रैंक को हमेशा ± अंतराल के साथ पढ़ें।

एजेंट बोर्ड बाकी बोर्डों से अलग काम करता है: यह ब्लाइंड-वोट प्राथमिकता के बजाय वास्तविक एजेंट सत्रों को मापता है। इसका मुख्य मीट्रिक, Net Improvement, एक प्रतिशत लाभ है — Elo रेटिंग नहीं — इसलिए इसकी तुलना बोर्डों के बीच नहीं की जा सकती। arena.ai पूरे लीडरबोर्ड पर पाँच और आयाम (Confirmed Success, Steerability, Bash Recovery और अन्य) भी रिपोर्ट करता है।

उपयोग बोर्ड OpenRouter से आता है और वास्तविक API token शेयर की गणना करता है — डेवलपर्स अपने वॉलेट से वोट कर रहे हैं, जो व्यक्तिपरक प्राथमिकता बोर्डों को पूरक करता है।

स्पीच बोर्ड Artificial Analysis से आते हैं: TTS ब्लाइंड-लिसनिंग Speech Arena Elo का उपयोग करता है; ASR AA-WER v2 का उपयोग करता है, जहाँ कम बेहतर है; और नेटिव Speech-to-Speech Big Bench Audio, Full Duplex Bench और τ-Voice के समान-भार वाले समग्र का उपयोग करता है, जहाँ अधिक बेहतर है। स्कोर की तुलना केवल उसी बोर्ड के भीतर करें। स्रोत: artificialanalysis.ai.

इंटेलिजेंस इंडेक्स बोर्ड आर्टिफिशियल एनालिसिस से आता है: यह कई सार्वजनिक बेंचमार्क को एक 0-100 इंटेलिजेंस इंडेक्स में संक्षिप्त करता है, जो व्यक्तिपरक प्राथमिकता के बजाय वस्तुनिष्ठ क्षमता को मापता है — यह arena.ai के मानव ब्लाइंड वोट का एक स्वाभाविक पूरक है। स्रोत: artificialanalysis.ai।