एआई मॉडल लीडरबोर्ड

बहु-स्रोत AI रैंकिंग चैट, भाषण, TTS, ASR, कोड, छवि, वीडियो और एजेंटों के लिए — arena.ai, OpenRouter और Artificial Analysis से।

रैंकमॉडलवेंडरAA-WER ↓ ?
1AlibabaFun-Realtime-ASR-previewAlibaba1.73%
2ElevenLabsScribe v2, ElevenLabsElevenLabs2.18%
3Microsoft AIMAI-Transcribe-1.5Microsoft AI2.38%
4Smallest.aiSmallest AI Pulse ProSmallest.ai2.43%
5GoogleGemini 3.5 TranscribeGoogle2.6%
6MistralVoxtral Small, MistralMistral2.77%
7GoogleGemini 3.1 Pro Preview (High)Google2.82%
8AssemblyAIUniversal-3.5 Pro, AssemblyAIAssemblyAI3.02%
9GladiaSolaria-3, GladiaGladia3.23%
10OpenAIGPT Transcribe, OpenAIOpenAI3.31%
11Reson8Resonant-1Reson83.39%
12Thinking MachinesInkling (256K), Thinking MachinesThinking Machines3.47%
13AlibabaQwen3.5 Omni PlusAlibaba3.55%
14GoogleGemini 3.1 Pro Preview (Low)Google3.58%
15MistralVoxtral Mini Transcribe 2, MistralMistral3.59%

स्रोत: Artificial Analysis · अपडेटेड Aug 29, 2026 · PandaNpc अपडेटेड 29 अग॰ 2026, 06:00 UTCपूरा लीडरबोर्ड देखें →

इन नंबरों को कैसे पढ़ें

arena.ai (पूर्व में LMArena) उपयोगकर्ताओं को एक ही प्रॉम्प्ट के दो अज्ञात उत्तर दिखाता है और उन्हें एक चुनने के लिए कहता है, फिर उन युद्धों से Elo रेटिंग प्राप्त करता है। यह मापता है कि लोग कौन सा उत्तर पसंद करते हैं — वस्तुनिष्ठ क्षमता नहीं। एक आकर्षक शैली जीत सकती है, जबकि एक कठोर लेकिन शब्दबहुल उत्तर हार सकता है।

वोट वे लड़ाइयाँ हैं जो एक मॉडल ने संचित की हैं। नवसूचीबद्ध मॉडल के पास कम वोट और एक व्यापक आत्मविश्वास अंतराल होता है, इसलिए इसकी रैंक आसानी से बदलती है — रैंक को हमेशा ± अंतराल के साथ पढ़ें।

एजेंट बोर्ड बाकी बोर्डों से अलग काम करता है: यह ब्लाइंड-वोट प्राथमिकता के बजाय वास्तविक एजेंट सत्रों को मापता है। इसका मुख्य मीट्रिक, Net Improvement, एक प्रतिशत लाभ है — Elo रेटिंग नहीं — इसलिए इसकी तुलना बोर्डों के बीच नहीं की जा सकती। arena.ai पूरे लीडरबोर्ड पर पाँच और आयाम (Confirmed Success, Steerability, Bash Recovery और अन्य) भी रिपोर्ट करता है।

उपयोग बोर्ड OpenRouter से आता है और वास्तविक API token शेयर की गणना करता है — डेवलपर्स अपने वॉलेट से वोट कर रहे हैं, जो व्यक्तिपरक प्राथमिकता बोर्डों को पूरक करता है।

स्पीच बोर्ड Artificial Analysis से आते हैं: TTS ब्लाइंड-लिसनिंग Speech Arena Elo का उपयोग करता है; ASR AA-WER v2 का उपयोग करता है, जहाँ कम बेहतर है; और नेटिव Speech-to-Speech Big Bench Audio, Full Duplex Bench और τ-Voice के समान-भार वाले समग्र का उपयोग करता है, जहाँ अधिक बेहतर है। स्कोर की तुलना केवल उसी बोर्ड के भीतर करें। स्रोत: artificialanalysis.ai.

इंटेलिजेंस इंडेक्स बोर्ड आर्टिफिशियल एनालिसिस से आता है: यह कई सार्वजनिक बेंचमार्क को एक 0-100 इंटेलिजेंस इंडेक्स में संक्षिप्त करता है, जो व्यक्तिपरक प्राथमिकता के बजाय वस्तुनिष्ठ क्षमता को मापता है — यह arena.ai के मानव ब्लाइंड वोट का एक स्वाभाविक पूरक है। स्रोत: artificialanalysis.ai।