एआई मॉडल लीडरबोर्ड
बहु-स्रोत AI रैंकिंग चैट, भाषण, TTS, ASR, कोड, छवि, वीडियो और एजेंटों के लिए — arena.ai, OpenRouter और Artificial Analysis से।
| रैंक | मॉडल | वेंडर | भाषण सूचकांक ? |
|---|---|---|---|
| 1 | Qwen Audio 3.0 Realtime Plus | Alibaba | 84% |
| 2 | Grok Voice Think Fast 2.0 High | SpaceXAI | 82.7% |
| 3 | GPT-Realtime-2.1 High | OpenAI | 79.3% |
| 4 | GPT-Realtime-2 High | OpenAI | 77.3% |
| 5 | Qwen Audio 3.0 Realtime Flash | Alibaba | 76.3% |
| 6 | Grok Voice Think Fast 1.0 | SpaceXAI | 75.7% |
| 7 | GPT-Realtime-2 Medium | OpenAI | 75% |
| 8 | GPT-Realtime-2.1 Minimal | OpenAI | 72.7% |
| 9 | GPT-Realtime-1.5 | OpenAI | 72% |
| 10 | GPT Realtime (Aug 2025) | OpenAI | 69% |
| 11 | GPT-Realtime-2 Minimal | OpenAI | 66.3% |
| 12 | GPT-Realtime-2.1 Mini High | OpenAI | 65.3% |
| 13 | Grok Voice Agent | SpaceXAI | 64% |
| 14 | Deepslate Opal | Deepslate | 63% |
| 15 | Higgs Realtime | Boson AI | 60.3% |
स्रोत: Artificial Analysis · अपडेटेड Aug 29, 2026 · PandaNpc अपडेटेड 29 अग॰ 2026, 06:00 UTCपूरा लीडरबोर्ड देखें →
इन नंबरों को कैसे पढ़ें
arena.ai (पूर्व में LMArena) उपयोगकर्ताओं को एक ही प्रॉम्प्ट के दो अज्ञात उत्तर दिखाता है और उन्हें एक चुनने के लिए कहता है, फिर उन युद्धों से Elo रेटिंग प्राप्त करता है। यह मापता है कि लोग कौन सा उत्तर पसंद करते हैं — वस्तुनिष्ठ क्षमता नहीं। एक आकर्षक शैली जीत सकती है, जबकि एक कठोर लेकिन शब्दबहुल उत्तर हार सकता है।
वोट वे लड़ाइयाँ हैं जो एक मॉडल ने संचित की हैं। नवसूचीबद्ध मॉडल के पास कम वोट और एक व्यापक आत्मविश्वास अंतराल होता है, इसलिए इसकी रैंक आसानी से बदलती है — रैंक को हमेशा ± अंतराल के साथ पढ़ें।
एजेंट बोर्ड बाकी बोर्डों से अलग काम करता है: यह ब्लाइंड-वोट प्राथमिकता के बजाय वास्तविक एजेंट सत्रों को मापता है। इसका मुख्य मीट्रिक, Net Improvement, एक प्रतिशत लाभ है — Elo रेटिंग नहीं — इसलिए इसकी तुलना बोर्डों के बीच नहीं की जा सकती। arena.ai पूरे लीडरबोर्ड पर पाँच और आयाम (Confirmed Success, Steerability, Bash Recovery और अन्य) भी रिपोर्ट करता है।
उपयोग बोर्ड OpenRouter से आता है और वास्तविक API token शेयर की गणना करता है — डेवलपर्स अपने वॉलेट से वोट कर रहे हैं, जो व्यक्तिपरक प्राथमिकता बोर्डों को पूरक करता है।
स्पीच बोर्ड Artificial Analysis से आते हैं: TTS ब्लाइंड-लिसनिंग Speech Arena Elo का उपयोग करता है; ASR AA-WER v2 का उपयोग करता है, जहाँ कम बेहतर है; और नेटिव Speech-to-Speech Big Bench Audio, Full Duplex Bench और τ-Voice के समान-भार वाले समग्र का उपयोग करता है, जहाँ अधिक बेहतर है। स्कोर की तुलना केवल उसी बोर्ड के भीतर करें। स्रोत: artificialanalysis.ai.
इंटेलिजेंस इंडेक्स बोर्ड आर्टिफिशियल एनालिसिस से आता है: यह कई सार्वजनिक बेंचमार्क को एक 0-100 इंटेलिजेंस इंडेक्स में संक्षिप्त करता है, जो व्यक्तिपरक प्राथमिकता के बजाय वस्तुनिष्ठ क्षमता को मापता है — यह arena.ai के मानव ब्लाइंड वोट का एक स्वाभाविक पूरक है। स्रोत: artificialanalysis.ai।
