LLM Leaderboard & AI Model Rankings
One page that aggregates the major AI benchmarks and leaderboards — Chatbot Arena Elo (arena.ai), the Artificial Analysis Intelligence Index and speech arenas, and OpenRouter usage — across chat, coding, TTS, speech-to-text, image, video and agents.
| Rank | Model | Vendor | Intelligence Index ? | Input ? | Output | Cache ? |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) | Anthropic | 57.6 | 4.00 | 20.0 | 0.200 |
| 2 | Claude Opus 5.5 (Adaptive Reasoning, Xhigh Effort, Default Fallback) | Anthropic | 56 | 4.00 | 20.0 | 0.200 |
| 3 | Claude Opus 5.5 (Adaptive Reasoning, High Effort, Default Fallback) | Anthropic | 53.6 | 4.00 | 20.0 | 0.200 |
| 4 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | Anthropic | 53.4 | 10.0 | 50.0 | 0.250 |
| 5 | Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) | Anthropic | 53.2 | 10.0 | 50.0 | 0.250 |
| 6 | GPT-6 Astra (max) | OpenAI | 52.7 | 10.0 | 50.0 | 1.00 |
| 7 | GPT-6 Astra (xhigh) | OpenAI | 52.4 | 10.0 | 50.0 | 1.00 |
| 8 | Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) | Anthropic | 51.2 | 10.0 | 50.0 | 0.250 |
| 9 | Claude Opus 5.5 (Adaptive Reasoning, Medium Effort, Default Fallback) | Anthropic | 51.2 | 4.00 | 20.0 | 0.200 |
| 10 | GPT-6 Astra (high) | OpenAI | 50.9 | 10.0 | 50.0 | 1.00 |
| 11 | Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 50.8 | 5.00 | 25.0 | 0.500 |
| 12 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 49.7 | 5.00 | 25.0 | 0.500 |
| 13 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 49.6 | 10.0 | 50.0 | 1.00 |
| 14 | GPT-6 Astra (medium) | OpenAI | 49.6 | 10.0 | 50.0 | 1.00 |
| 15 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) | Anthropic | 48.9 | 10.0 | 50.0 | 0.250 |
| 16 | Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 48.1 | 5.00 | 25.0 | 0.500 |
| 17 | Muse Spark 1.3 (max) | Meta | 48.1 | 1.25 | 4.25 | 0.150 |
| 18 | GPT-6 Sol (max) | OpenAI | 47.5 | 2.00 | 10.0 | 0.200 |
| 19 | GPT-5.6 Sol (max) | OpenAI | 47 | 2.00 | 10.0 | 0.200 |
| 20 | Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback) | Anthropic | 46.8 | 10.0 | 50.0 | 0.250 |
| 21 | Grok 4.7 (xhigh) | SpaceXAI | 46.4 | 1.60 | 4.80 | 0.400 |
| 22 | MiMo-V2.6-Pro | Xiaomi | 46.3 | 0.435 | 0.870 | 0.0036 |
| 23 | Grok 4.7 (high) | SpaceXAI | 46.3 | 1.60 | 4.80 | 0.400 |
| 24 | GPT-6 Astra (low) | OpenAI | 45.8 | 10.0 | 50.0 | 1.00 |
| 25 | Qwen3.8 Max (0902) | Alibaba | 45.4 | 2.00 | 6.00 | 0.250 |
| 26 | Muse Spark 1.3 (xhigh) | Meta | 45.1 | 1.25 | 4.25 | 0.150 |
| 27 | GLM-5.3 (max) | Z AI | 44.8 | 0.330 | 1.20 | 0.084 |
| 28 | Claude Opus 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 44.8 | 5.00 | 25.0 | 0.500 |
| 29 | Grok 4.6 (high) | SpaceXAI | 44.3 | 2.00 | 6.00 | 0.500 |
| 30 | Grok 4.6 (xhigh) | SpaceXAI | 44.2 | 2.00 | 6.00 | 0.500 |
| 31 | GPT-6 Sol (xhigh) | OpenAI | 44.1 | 2.00 | 10.0 | 0.200 |
| 32 | GPT-5.6 Sol (xhigh) | OpenAI | 44 | 2.00 | 10.0 | 0.200 |
| 33 | Step 5 Preview | StepFun | 43.7 | — | — | — |
| 34 | Kimi K3 (max) | Kimi | 43.6 | 3.00 | 15.0 | 0.300 |
| 35 | Grok 4.6 (medium) | SpaceXAI | 42.8 | 2.00 | 6.00 | 0.500 |
| 36 | GPT-6 Sol (high) | OpenAI | 42.8 | 2.00 | 10.0 | 0.200 |
| 37 | Claude Opus 5.5 (Adaptive Reasoning, Low Effort, Default Fallback) | Anthropic | 42.3 | 4.00 | 20.0 | 0.200 |
| 38 | GPT-5.6 Sol (high) | OpenAI | 42.3 | 2.00 | 10.0 | 0.200 |
| 39 | GPT-5.6 Terra (max) | OpenAI | 42.1 | 2.00 | 12.0 | 0.200 |
| 40 | GLM 5.3 Flash | Z AI | 41.8 | 0.150 | 0.500 | 0.030 |
| 41 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 41.8 | 5.00 | 25.0 | 0.500 |
| 42 | Gemini 3.8 Flash (high) | 40.9 | 0.750 | 3.75 | 0.075 | |
| 43 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 40.7 | 5.00 | 25.0 | 0.500 |
| 44 | Qwen3.8 Max | Alibaba | 40.2 | 2.00 | 6.00 | 0.250 |
| 45 | Qwen3.8 2.4T A95B | Alibaba | 39.9 | 2.00 | 6.00 | 0.250 |
| 46 | Gemini 3.8 Flash (medium) | 39.8 | 0.750 | 3.75 | 0.075 | |
| 47 | GPT-6 Sol (medium) | OpenAI | 39.8 | 2.00 | 10.0 | 0.200 |
| 48 | Qwen3.8-Flash-Next | Alibaba | 39.8 | — | — | — |
| 49 | Muse Spark 1.2 (xhigh) | Meta | 39.6 | 1.25 | 4.25 | 0.150 |
| 50 | Gemini 3.7 Flash (medium) | 39.6 | 0.750 | 3.75 | 0.075 | |
| 51 | DeepSeek V4.1 Flash (Reasoning, Max Effort) | DeepSeek | 39.5 | 0.030 | 0.600 | 0.0060 |
| 52 | Claude Opus 5 (Adaptive Reasoning, Low Effort) | Anthropic | 39.4 | 5.00 | 25.0 | 0.500 |
| 53 | GPT-5.6 Sol (medium) | OpenAI | 39.2 | 2.00 | 10.0 | 0.200 |
| 54 | Gemini 3.7 Flash (high) | 39.1 | 0.750 | 3.75 | 0.075 | |
| 55 | GPT-5.4 (xhigh) | OpenAI | 39 | 2.50 | 15.0 | 0.250 |
| 56 | Grok 4.5 (high) | SpaceXAI | 38.8 | 2.00 | 6.00 | 0.300 |
| 57 | GPT-5.5 (xhigh) | OpenAI | 38.4 | 5.00 | 30.0 | 0.500 |
| 58 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | Anthropic | 38.2 | 2.00 | 10.0 | 0.200 |
| 59 | GPT-5.6 Terra (xhigh) | OpenAI | 38 | 2.00 | 12.0 | 0.200 |
| 60 | MiMo-V2.6-Flash | Xiaomi | 37.9 | 0.140 | 0.280 | 0.0028 |
| 61 | GPT-5.6 Luna (max) | OpenAI | 37.3 | 0.200 | 1.20 | 0.020 |
| 62 | GPT-6 Luna (max) | OpenAI | 37.3 | 0.100 | 0.500 | 0.010 |
| 63 | GPT-5.5 (high) | OpenAI | 37 | 5.00 | 30.0 | 0.500 |
| 64 | Gemini 3.7 Flash (low) | 36.9 | 0.750 | 3.75 | 0.075 | |
| 65 | DeepSeek V4 Pro 0813 (Reasoning, Max Effort) | DeepSeek | 36 | 0.252 | 4.20 | 0.252 |
| 66 | Grok 4.6 (low) | SpaceXAI | 35.1 | 2.00 | 6.00 | 0.500 |
| 67 | DeepSeek V4 Flash Vision (Reasoning, Max Effort) | DeepSeek | 34.8 | 0.440 | 1.32 | 0.014 |
| 68 | GPT-5.6 Luna (xhigh) | OpenAI | 34.6 | 0.200 | 1.20 | 0.020 |
| 69 | Kimi K3 (low) | Kimi | 34.5 | 3.00 | 15.0 | 0.300 |
| 70 | Claude Sonnet 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 34.4 | 2.00 | 10.0 | 0.200 |
| 71 | GLM-5.3 (low) | Z AI | 34.3 | 0.330 | 1.20 | 0.084 |
| 72 | DeepSeek V4 Flash 0731 (Reasoning, Max Effort) | DeepSeek | 34.3 | 0.021 | 0.320 | 0.016 |
| 73 | GPT-5.6 Terra (high) | OpenAI | 34.2 | 2.00 | 12.0 | 0.200 |
| 74 | Gemini 3.6 Flash (high) | 34 | 0.750 | 3.75 | 0.075 | |
| 75 | GPT-6 Sol (low) | OpenAI | 33.9 | 2.00 | 10.0 | 0.200 |
| 76 | GPT-6 Luna (xhigh) | OpenAI | 33.9 | 0.100 | 0.500 | 0.010 |
| 77 | GPT-5.5 (medium) | OpenAI | 33.8 | 5.00 | 30.0 | 0.500 |
| 78 | Qwen3.8 27B (xhigh) | Alibaba | 33.7 | 0.420 | 3.00 | 0.085 |
| 79 | Muse Spark 1.1 (xhigh) | Meta | 33.7 | 1.25 | 4.25 | 0.150 |
| 80 | GLM-5.2 (max) | Z AI | 33.7 | 0.650 | 2.04 | 0.121 |
| 81 | Gemini 3.5 Flash (medium) | 33.6 | 1.50 | 9.00 | 0.150 | |
| 82 | Motif 3 | Motif Technologies | 33.6 | — | — | — |
| 83 | GPT-5.6 Sol (low) | OpenAI | 33.5 | 2.00 | 10.0 | 0.200 |
| 84 | Gemini 3.8 Flash (low) | 33.5 | 0.750 | 3.75 | 0.075 | |
| 85 | Gemini 3.5 Flash (high) | 32.6 | 1.50 | 9.00 | 0.150 | |
| 86 | GPT-5.3 Codex (xhigh) | OpenAI | 32.5 | 1.75 | 14.0 | 0.175 |
| 87 | Motif 3 (Beta) | Motif Technologies | 32.3 | — | — | — |
| 88 | GPT-6 Luna (high) | OpenAI | 32.1 | 0.100 | 0.500 | 0.010 |
| 89 | GPT-5.6 Luna (high) | OpenAI | 32.1 | 0.200 | 1.20 | 0.020 |
| 90 | Claude Opus 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 31.9 | 5.00 | 25.0 | 0.500 |
| 91 | Claude Sonnet 5 (Adaptive Reasoning, High Effort) | Anthropic | 31.7 | 2.00 | 10.0 | 0.200 |
| 92 | Muse Spark | Meta | 31.3 | — | — | — |
| 93 | Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 30.9 | 5.00 | 25.0 | 0.500 |
| 94 | GPT-5.5 (low) | OpenAI | 30.7 | 5.00 | 30.0 | 0.500 |
| 95 | K2 Horizon 375B A23B | Institute of Foundation Models | 30.5 | — | — | — |
| 96 | GPT-5.2 (xhigh) | OpenAI | 30.4 | 1.75 | 14.0 | 0.175 |
| 97 | DeepSeek V4 Pro 0424 (Reasoning, Max Effort) | DeepSeek | 30.4 | 0.252 | 4.20 | 0.252 |
| 98 | GPT-5.6 Terra (medium) | OpenAI | 30.1 | 2.00 | 12.0 | 0.200 |
| 99 | DeepSeek V4 Pro 0424 (Reasoning, High Effort) | DeepSeek | 30.1 | 0.252 | 4.20 | 0.252 |
| 100 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 30.1 | 3.00 | 15.0 | 0.300 |
| 101 | Gemini 3.1 Pro Preview | 29.7 | 2.00 | 12.0 | 0.200 | |
| 102 | GPT-6 Luna (medium) | OpenAI | 29.5 | 0.100 | 0.500 | 0.010 |
| 103 | Qwen3.7 Max | Alibaba | 29.5 | 1.48 | 4.42 | 0.295 |
| 104 | MiniMax-M3 | MiniMax | 29.2 | 0.300 | 1.20 | 0.060 |
| 105 | Claude Opus 4.5 (Reasoning) | Anthropic | 29.1 | 5.00 | 25.0 | 0.500 |
| 106 | MiMo-V2-Pro | Xiaomi | 28.6 | — | — | — |
| 107 | GPT-5.2 Codex (xhigh) | OpenAI | 28.5 | 1.75 | 14.0 | 0.175 |
| 108 | Qwen3.6 Max Preview | Alibaba | 28.4 | 1.03 | 6.16 | — |
| 109 | GPT-5.6 Sol (Non-reasoning) | OpenAI | 28.3 | 2.00 | 10.0 | 0.200 |
| 110 | Solar Pro 4 | Upstage | 28.2 | — | — | — |
| 111 | Nex-N2-Pro (based on Qwen3.5-397B-A17B) | Nex AGI | 28.2 | — | — | — |
| 112 | GPT-6 Sol (Non-reasoning) | OpenAI | 28.1 | 2.00 | 10.0 | 0.200 |
| 113 | Claude Sonnet 5 (Adaptive Reasoning, Medium Effort) | Anthropic | 28.1 | 2.00 | 10.0 | 0.200 |
| 114 | Gemini 3 Pro Preview (high) | 28 | — | — | — | |
| 115 | GLM-5 (Reasoning) | Z AI | 27.9 | 0.600 | 1.92 | 0.120 |
| 116 | Inkling Small | Thinking Machines | 27.8 | 0.450 | 1.20 | 0.100 |
| 117 | GPT-5.4 (low) | OpenAI | 27.6 | 2.50 | 15.0 | 0.250 |
| 118 | Qwen3.8 27B (medium) | Alibaba | 27.6 | 0.420 | 3.00 | 0.085 |
| 119 | GPT-5.6 Terra (low) | OpenAI | 27.5 | 2.00 | 12.0 | 0.200 |
| 120 | JT-4.1 Flash 236B A21B | China Mobile | 27.3 | — | — | — |
| 121 | Grok Build 0.1 0616 | SpaceXAI | 27.2 | 1.00 | 2.00 | 0.200 |
| 122 | Kimi K2.6 | Kimi | 27 | 0.650 | 3.41 | 0.150 |
| 123 | Qwen3.6 Plus | Alibaba | 27 | 0.325 | 1.95 | — |
| 124 | Quasar 438B (max, based on GLM-5.2) | Multiverse Computing | 26.7 | — | — | — |
| 125 | GLM-5-Turbo | Z AI | 26.6 | 1.20 | 4.00 | 0.240 |
| 126 | GPT-5.2 (medium) | OpenAI | 26.5 | 1.75 | 14.0 | 0.175 |
| 127 | Apodex 1.1 | Apodex | 26.4 | — | — | — |
| 128 | Claude Opus 4.6 (Non-reasoning, High Effort) | Anthropic | 26.4 | 5.00 | 25.0 | 0.500 |
| 129 | Gemini 3 Flash Preview (Reasoning) | 26.3 | 0.500 | 3.00 | 0.050 | |
| 130 | Qwen3.8 27B (low) | Alibaba | 26.2 | 0.420 | 3.00 | 0.085 |
| 131 | GLM-5.1 (Reasoning) | Z AI | 26.1 | 1.40 | 4.40 | 0.260 |
| 132 | MiMo-V2.5-Pro | Xiaomi | 26 | 0.435 | 0.870 | 0.0036 |
| 133 | DeepSeek V4 Flash 0420 (Reasoning, High Effort) | DeepSeek | 26 | 0.021 | 0.320 | 0.016 |
| 134 | GPT-5.5 Instant (June 2026) | OpenAI | 26 | 5.00 | 30.0 | 0.500 |
| 135 | Kimi K2.7 Code | Kimi | 25.8 | 0.656 | 3.30 | 0.180 |
| 136 | Grok 4.20 0309 v2 (Reasoning) | SpaceXAI | 25.7 | — | — | — |
| 137 | K2 Horizon MoVA 36B A4B | Institute of Foundation Models | 25.3 | — | — | — |
| 138 | Hy3 | Tencent | 25.3 | 0.132 | 0.528 | 0.033 |
| 139 | Grok 4.20 0309 (Reasoning) | SpaceXAI | 25.2 | 1.25 | 2.50 | 0.200 |
| 140 | MiMo-V2.5 | Xiaomi | 25.2 | 0.140 | 0.280 | 0.0028 |
| 141 | Qwen3.7 Plus | Alibaba | 25.2 | 0.320 | 1.28 | 0.064 |
| 142 | MiMo-V2-Omni-0327 | Xiaomi | 25.1 | — | — | — |
| 143 | Inkling (xhigh) | Thinking Machines | 25 | 1.00 | 4.05 | 0.170 |
| 144 | GPT-5.6 Luna (medium) | OpenAI | 25 | 0.200 | 1.20 | 0.020 |
| 145 | GPT-5 Codex (high) | OpenAI | 24.9 | — | — | — |
| 146 | Grok 4.3 (high) | SpaceXAI | 24.9 | 1.25 | 2.50 | 0.200 |
| 147 | Ling 3.0 Flash | InclusionAI | 24.9 | 0.021 | 0.063 | 0.0042 |
| 148 | Grok 4.3 (medium) | SpaceXAI | 24.8 | 1.25 | 2.50 | 0.200 |
| 149 | Claude Sonnet 4.6 (Non-reasoning, High Effort) | Anthropic | 24.7 | 3.00 | 15.0 | 0.300 |
| 150 | GPT-5.1 (high) | OpenAI | 24.7 | 1.25 | 10.0 | 0.125 |
| 151 | DeepSeek V4.1 Flash (Non-Reasoning) | DeepSeek | 24.7 | 0.030 | 0.600 | 0.0060 |
| 152 | Solar Open2 250B | Upstage | 24.7 | — | — | — |
| 153 | Ling-3.0-flash-VL | InclusionAI | 24.6 | 0.021 | 0.062 | 0.0042 |
| 154 | Claude Sonnet 5 (Adaptive Reasoning, Low Effort) | Anthropic | 24.3 | 2.00 | 10.0 | 0.200 |
| 155 | Grok 4.3 (low) | SpaceXAI | 24.3 | 1.25 | 2.50 | 0.200 |
| 156 | GLM-5.1 (Non-reasoning) | Z AI | 24.2 | 1.40 | 4.40 | 0.260 |
| 157 | DeepSeek V4 Flash 0420 (Reasoning, Max Effort) | DeepSeek | 24.2 | 0.021 | 0.320 | 0.016 |
| 158 | GPT-5.4 mini (xhigh) | OpenAI | 24.1 | 0.750 | 4.50 | 0.075 |
| 159 | MiMo-V2-Omni | Xiaomi | 23.9 | — | — | — |
| 160 | Gemini 3.5 Flash (minimal) | 23.8 | 1.50 | 9.00 | 0.150 | |
| 161 | GPT-5.1 Codex (high) | OpenAI | 23.7 | 1.25 | 10.0 | 0.125 |
| 162 | Claude Opus 4.5 (Non-reasoning) | Anthropic | 23.7 | 5.00 | 25.0 | 0.500 |
| 163 | Kimi K2.6 (Non-reasoning) | Kimi | 23.6 | 0.650 | 3.41 | 0.150 |
| 164 | GLM 5V Turbo (Reasoning) | Z AI | 23.5 | 1.20 | 4.00 | 0.240 |
| 165 | Kimi K2.5 (Reasoning) | Kimi | 23.5 | 0.450 | 2.25 | 0.070 |
| 166 | Claude Sonnet 4.6 (Non-reasoning, Low Effort) | Anthropic | 23.3 | 3.00 | 15.0 | 0.300 |
| 167 | GPT-5.5 (Non-reasoning) | OpenAI | 23.2 | 5.00 | 30.0 | 0.500 |
| 168 | Claude Sonnet 5 (Non-reasoning, High Effort) | Anthropic | 23.2 | 2.00 | 10.0 | 0.200 |
| 169 | GPT-5 (high) | OpenAI | 23 | 1.25 | 10.0 | 0.125 |
| 170 | Qwen3.5 27B (Reasoning) | Alibaba | 22.9 | 0.195 | 1.56 | — |
| 171 | Nemotron 3 Ultra 550B A55B (Reasoning) | NVIDIA | 22.9 | 0.600 | 2.40 | 0.120 |
| 172 | GPT-5 (medium) | OpenAI | 22.9 | 1.25 | 10.0 | 0.125 |
| 173 | MiniMax-M2.5 | MiniMax | 22.8 | 0.270 | 1.08 | 0.027 |
| 174 | MiniMax-M2.7 | MiniMax | 22.8 | 0.300 | 1.20 | 0.060 |
| 175 | Claude 4.1 Opus (Reasoning) | Anthropic | 22.8 | 15.0 | 75.0 | 1.50 |
| 176 | A.X-K2 | SK Telecom | 22.7 | — | — | — |
| 177 | Hy3-preview (Reasoning) | Tencent | 22.7 | 0.132 | 0.528 | 0.033 |
| 178 | GPT-5.5 Instant (May 2026) | OpenAI | 22.7 | 5.00 | 30.0 | 0.500 |
| 179 | Ling-3.0-flash-Fin | InclusionAI | 22.6 | 0.060 | 0.180 | 0.012 |
| 180 | Grok 4 | SpaceXAI | 22.5 | — | — | — |
| 181 | MiMo-V2-Flash (Feb 2026) | Xiaomi | 22.4 | — | — | — |
| 182 | GLM-5.2 (Non-reasoning) | Z AI | 22.4 | 0.650 | 2.04 | 0.121 |
| 183 | Gemini 3 Pro Preview (low) | 22.3 | — | — | — | |
| 184 | Gemini 3.5 Flash-Lite | 22.2 | 0.300 | 2.50 | 0.030 | |
| 185 | GLM-4.7 (Reasoning) | Z AI | 22.2 | 0.600 | 2.20 | 0.110 |
| 186 | Kimi K2 Thinking | Kimi | 22 | 0.600 | 2.50 | 0.150 |
| 187 | o3-pro | OpenAI | 21.9 | 20.0 | 80.0 | — |
| 188 | G9v3-39A5B | AI9Stars | 21.8 | — | — | — |
| 189 | GLM-5 (Non-reasoning) | Z AI | 21.8 | 0.600 | 1.92 | 0.120 |
| 190 | KAT Coder Pro V2 | KwaiKAT | 21.7 | — | — | — |
| 191 | DeepSeek V3.2 (Reasoning) | DeepSeek | 21.5 | 0.280 | 0.420 | 0.028 |
| 192 | Qwen3.5 397B A17B (Non-reasoning) | Alibaba | 21.4 | 0.550 | 3.50 | 0.225 |
| 193 | Qwen3.6 27B (Reasoning) | Alibaba | 21.4 | 0.320 | 3.20 | — |
| 194 | Qwen3 Max Thinking | Alibaba | 21.3 | 0.780 | 3.90 | — |
| 195 | GPT-5.6 Luna (low) | OpenAI | 21 | 0.200 | 1.20 | 0.020 |
| 196 | MiniMax-M2.1 | MiniMax | 20.9 | 0.300 | 1.20 | 0.030 |
| 197 | GPT-6 Luna (low) | OpenAI | 20.9 | 0.100 | 0.500 | 0.010 |
| 198 | DeepSeek V4 Pro 0424 (Non-reasoning) | DeepSeek | 20.8 | 0.252 | 4.20 | 0.252 |
| 199 | GPT-5 (low) | OpenAI | 20.8 | 1.25 | 10.0 | 0.125 |
| 200 | GPT-5.6 Terra (Non-reasoning) | OpenAI | 20.8 | 2.00 | 12.0 | 0.200 |
| 201 | MiMo-V2-Flash (Reasoning) | Xiaomi | 20.8 | — | — | — |
| 202 | Claude 4.5 Sonnet (Reasoning) | Anthropic | 20.7 | 3.00 | 15.0 | 0.300 |
| 203 | GPT-5.4 nano (xhigh) | OpenAI | 20.7 | 0.200 | 1.25 | 0.020 |
| 204 | K2 Horizon 7B | Institute of Foundation Models | 20.6 | — | — | — |
| 205 | Claude 4 Opus (Reasoning) | Anthropic | 20.6 | — | — | — |
| 206 | GPT-5 mini (medium) | OpenAI | 20.6 | 0.250 | 2.00 | 0.025 |
| 207 | Qwen3.5 Omni Plus | Alibaba | 20.4 | — | — | — |
| 208 | Grok 4.1 Fast (Reasoning) | SpaceXAI | 20.4 | — | — | — |
| 209 | GPT-5.1 Codex mini (high) | OpenAI | 20.4 | 0.250 | 2.00 | 0.030 |
| 210 | o3 | OpenAI | 20.2 | 2.00 | 8.00 | 0.500 |
| 211 | Qwen3.8 27B (Non-reasoning) | Alibaba | 20.2 | 0.420 | 3.00 | 0.085 |
| 212 | GPT-5.4 nano (medium) | OpenAI | 20 | 0.200 | 1.25 | 0.020 |
| 213 | Qwen3.6 27B (Non-reasoning) | Alibaba | 19.8 | 0.320 | 3.20 | — |
| 214 | K-EXAONE 2.0 0803 | LG AI Research | 19.7 | — | — | — |
| 215 | GPT-5.4 mini (medium) | OpenAI | 19.7 | 0.750 | 4.50 | 0.075 |
| 216 | Step 3.7 Flash | StepFun | 19.5 | 0.200 | 1.15 | 0.040 |
| 217 | Qwen3.5 27B (Non-reasoning) | Alibaba | 19.4 | 0.195 | 1.56 | — |
| 218 | Kimi K2.5 (Non-reasoning) | Kimi | 19.4 | 0.450 | 2.25 | 0.070 |
| 219 | Qwen3.5 35B A3B (Reasoning) | Alibaba | 19.3 | 0.163 | 1.30 | — |
| 220 | Claude 4.5 Sonnet (Non-reasoning) | Anthropic | 19.3 | 3.00 | 15.0 | 0.300 |
| 221 | LongCat 2.0 | LongCat | 19.1 | 0.300 | 1.20 | 0.0060 |
| 222 | Gemma 4 31B (Reasoning) | 19 | 0.090 | 0.340 | 0.050 | |
| 223 | Claude 4 Sonnet (Reasoning) | Anthropic | 18.9 | 3.00 | 15.0 | 0.300 |
| 224 | DeepSeek V4 Flash 0420 (Non-reasoning) | DeepSeek | 18.9 | 0.021 | 0.320 | 0.016 |
| 225 | JT-35B-Flash | China Mobile | 18.7 | — | — | — |
| 226 | Claude 4.1 Opus (Non-reasoning) | Anthropic | 18.6 | 15.0 | 75.0 | 1.50 |
| 227 | MiniMax-M2 | MiniMax | 18.6 | 0.300 | 1.20 | — |
| 228 | KAT-Coder-Pro V1 | KwaiKAT | 18.6 | — | — | — |
| 229 | GLM-4.6 (Reasoning) | Z AI | 18.5 | 0.430 | 1.75 | 0.080 |
| 230 | Qwen3.5 397B A17B (Reasoning) | Alibaba | 18.4 | 0.550 | 3.50 | 0.225 |
| 231 | MiMo-V2.5-Pro (Non-reasoning) | Xiaomi | 18.3 | 0.435 | 0.870 | 0.0036 |
| 232 | GPT-6 Luna (Non-reasoning) | OpenAI | 18.3 | 0.100 | 0.500 | 0.010 |
| 233 | GPT-5.4 (Non-reasoning) | OpenAI | 18.2 | 2.50 | 15.0 | 0.250 |
| 234 | Qwen3.6 35B A3B (Reasoning) | Alibaba | 18.2 | 0.150 | 1.00 | 0.050 |
| 235 | Grok 4 Fast (Reasoning) | SpaceXAI | 17.9 | — | — | — |
| 236 | Gemini 3 Flash Preview (Non-reasoning) | 17.9 | 0.500 | 3.00 | 0.050 | |
| 237 | Qwen3.5 122B A10B (Non-reasoning) | Alibaba | 17.7 | 0.260 | 2.08 | — |
| 238 | Claude 3.7 Sonnet (Reasoning) | Anthropic | 17.7 | — | — | — |
| 239 | Muse Glimmer (high) | Meta | 17.5 | — | — | — |
| 240 | GLM-4.7 (Non-reasoning) | Z AI | 17.4 | 0.600 | 2.20 | 0.110 |
| 241 | Step 3.5 Flash 2603 | StepFun | 17 | 0.100 | 0.300 | — |
| 242 | Ling-2.6-1T | InclusionAI | 17 | — | — | — |
| 243 | GPT-5.2 (Non-reasoning) | OpenAI | 17 | 1.75 | 14.0 | 0.175 |
| 244 | Hy3-preview (Non-reasoning) | Tencent | 17 | 0.132 | 0.528 | 0.033 |
| 245 | Doubao Seed Code | ByteDance Seed | 16.9 | — | — | — |
| 246 | Claude 4.5 Haiku (Reasoning) | Anthropic | 16.9 | 1.00 | 5.00 | 0.100 |
| 247 | GPT-5 mini (high) | OpenAI | 16.8 | 0.250 | 2.00 | 0.025 |
| 248 | Gemma 4 26B A4B (Reasoning) | 16.7 | 0.068 | 0.225 | 0.037 | |
| 249 | o4-mini (high) | OpenAI | 16.7 | 1.10 | 4.40 | 0.275 |
| 250 | Claude 4 Opus (Non-reasoning) | Anthropic | 16.6 | — | — | — |
| 251 | DeepSeek V3.2 Exp (Reasoning) | DeepSeek | 16.6 | 0.280 | 0.420 | 0.028 |
| 252 | Step 3.5 Flash | StepFun | 16.6 | 0.100 | 0.300 | — |
| 253 | Claude 4 Sonnet (Non-reasoning) | Anthropic | 16.6 | 3.00 | 15.0 | 0.300 |
| 254 | Ring-2.6-1T | InclusionAI | 16.6 | — | — | — |
| 255 | Qwen3 Max Thinking (Preview) | Alibaba | 16.3 | 0.780 | 3.90 | — |
| 256 | Gemini 2.5 Pro | 16.1 | 1.25 | 10.0 | 0.125 | |
| 257 | DeepSeek V3.2 (Non-reasoning) | DeepSeek | 16 | 0.280 | 0.420 | 0.028 |
| 258 | MiMo-V2-Flash (Non-reasoning) | Xiaomi | 16 | — | — | — |
| 259 | Qwen3.5 122B A10B (Reasoning) | Alibaba | 15.6 | 0.260 | 2.08 | — |
| 260 | K2 Horizon 3.7B | Institute of Foundation Models | 15.6 | — | — | — |
| 261 | Gemini 3.1 Flash-Lite | 15.6 | 0.250 | 1.50 | 0.025 | |
| 262 | Qwen3 Max | Alibaba | 15.6 | 0.780 | 3.90 | — |
| 263 | Gemini 2.5 Flash Preview (Sep '25) (Reasoning) | 15.5 | 0.300 | 2.50 | 0.030 | |
| 264 | GPT-5.6 Luna (Non-reasoning) | OpenAI | 15.5 | 0.200 | 1.20 | 0.020 |
| 265 | Claude 4.5 Haiku (Non-reasoning) | Anthropic | 15.4 | 1.00 | 5.00 | 0.100 |
| 266 | Kimi K2 0905 | Kimi | 15.3 | 0.600 | 2.50 | 0.150 |
| 267 | Ling 3.0 Tiny | InclusionAI | 15.3 | — | — | — |
| 268 | Claude 3.7 Sonnet (Non-reasoning) | Anthropic | 15.3 | — | — | — |
| 269 | o1 | OpenAI | 15.2 | 15.0 | 60.0 | 7.50 |
| 270 | Qwen3.6 35B A3B (Non-reasoning) | Alibaba | 15.2 | 0.150 | 1.00 | 0.050 |
| 271 | Qwen3.5 35B A3B (Non-reasoning) | Alibaba | 15.1 | 0.163 | 1.30 | — |
| 272 | Gemini 2.5 Pro Preview (Mar' 25) | 15 | 1.25 | 10.0 | 0.125 | |
| 273 | GLM-4.7-Flash (Reasoning) | Z AI | 14.9 | 0.060 | 0.400 | — |
| 274 | GLM-4.6 (Non-reasoning) | Z AI | 14.9 | 0.430 | 1.75 | 0.080 |
| 275 | DeepSeek V3.1 Terminus (Reasoning) | DeepSeek | 14.8 | 0.270 | 1.00 | 0.135 |
| 276 | Granite 4.2 30B | IBM | 14.8 | — | — | — |
| 277 | Grok 4.20 0309 (Non-reasoning) | SpaceXAI | 14.6 | 1.25 | 2.50 | 0.200 |
| 278 | Grok 3 mini Reasoning (high) | SpaceXAI | 14.6 | — | — | — |
| 279 | Gemini 2.5 Pro Preview (May' 25) | 14.5 | 1.25 | 10.0 | 0.125 | |
| 280 | DeepSeek V3.2 Speciale | DeepSeek | 14.5 | — | — | — |
| 281 | K-EXAONE (Reasoning) | LG AI Research | 14.4 | — | — | — |
| 282 | ERNIE 5.0 Thinking Preview | Baidu | 14.3 | — | — | — |
| 283 | Nova 2.0 Pro Preview (medium) | Amazon | 14.2 | — | — | — |
| 284 | Grok 4.20 0309 v2 (Non-reasoning) | SpaceXAI | 14.2 | — | — | — |
| 285 | Mistral Medium 3.5 | Mistral | 14.2 | 1.50 | 7.50 | — |
| 286 | Gemma 4 12B (Reasoning) | 14.2 | — | — | — | |
| 287 | Grok Code Fast 1 | SpaceXAI | 14.1 | — | — | — |
| 288 | Grok 4.3 (Non-reasoning) | SpaceXAI | 14 | 1.25 | 2.50 | 0.200 |
| 289 | DeepSeek V3.2 Exp (Non-reasoning) | DeepSeek | 13.9 | 0.280 | 0.420 | 0.028 |
| 290 | Gemma 4 31B (Non-reasoning) | 13.9 | 0.090 | 0.340 | 0.050 | |
| 291 | DeepSeek V3.1 Terminus (Non-reasoning) | DeepSeek | 13.9 | 0.270 | 1.00 | 0.135 |
| 292 | Mercury 2 | Inception | 13.8 | 0.250 | 0.750 | 0.025 |
| 293 | Apriel-v1.5-15B-Thinker | ServiceNow | 13.8 | — | — | — |
| 294 | Qwen3.5 9B (Reasoning) | Alibaba | 13.7 | 0.100 | 0.150 | — |
| 295 | DeepSeek V3.1 (Non-reasoning) | DeepSeek | 13.7 | — | — | — |
| 296 | Nova 2.0 Omni (medium) | Amazon | 13.6 | — | — | — |
| 297 | DeepSeek V3.1 (Reasoning) | DeepSeek | 13.5 | — | — | — |
| 298 | Nova 2.0 Lite (high) | Amazon | 13.4 | — | — | — |
| 299 | Apriel-v1.6-15B-Thinker | ServiceNow | 13.4 | — | — | — |
| 300 | Qwen3 VL 235B A22B (Reasoning) | Alibaba | 13.4 | 0.400 | 4.00 | — |
| 301 | Qwen3.5 9B (Non-reasoning) | Alibaba | 13.3 | 0.100 | 0.150 | — |
| 302 | GPT-5.1 (Non-reasoning) | OpenAI | 13.3 | 1.25 | 10.0 | 0.125 |
| 303 | EXAONE 4.5 33B | LG AI Research | 13.2 | — | — | — |
| 304 | Gemini 2.5 Flash (Reasoning) | 13.1 | 0.300 | 2.50 | 0.030 | |
| 305 | Command A+ | Cohere | 13.1 | — | — | — |
| 306 | Qwen3.5 4B (Reasoning) | Alibaba | 13.1 | — | — | — |
| 307 | Gemma 4 26B A4B (Non-reasoning) | 13.1 | 0.068 | 0.225 | 0.037 | |
| 308 | DeepSeek R1 0528 (May '25) | DeepSeek | 13.1 | 0.500 | 2.15 | 0.350 |
| 309 | GPT-5 nano (high) | OpenAI | 13 | 0.050 | 0.400 | 0.0050 |
| 310 | Nemotron 3.5 Lightning | NVIDIA | 12.9 | 0.080 | 0.200 | 0.040 |
| 311 | GLM-4.5 (Reasoning) | Z AI | 12.8 | 0.600 | 2.20 | 0.110 |
| 312 | Nemotron 3 Super 120B A12B (Reasoning) | NVIDIA | 12.8 | 0.080 | 0.450 | — |
| 313 | Nova 2.0 Pro Preview (low) | Amazon | 12.8 | — | — | — |
| 314 | GPT-4.1 | OpenAI | 12.7 | 2.00 | 8.00 | 0.500 |
| 315 | Kimi K2 | Kimi | 12.7 | 0.600 | 2.50 | 0.150 |
| 316 | Qwen3 235B A22B 2507 (Reasoning) | Alibaba | 12.7 | 0.230 | 2.30 | — |
| 317 | Qwen3 Max (Preview) | Alibaba | 12.6 | 0.780 | 3.90 | — |
| 318 | o3-mini | OpenAI | 12.5 | 1.10 | 4.40 | 0.550 |
| 319 | MiniCPM5-2B | OpenBMB | 12.5 | — | — | — |
| 320 | Qwen3.5 Omni Flash | Alibaba | 12.5 | — | — | — |
| 321 | GPT-5 nano (medium) | OpenAI | 12.5 | 0.050 | 0.400 | 0.0050 |
| 322 | Nova 2.0 Lite (medium) | Amazon | 12.5 | — | — | — |
| 323 | Gemini 2.5 Flash Preview (Sep '25) (Non-reasoning) | 12.4 | 0.300 | 2.50 | 0.030 | |
| 324 | o1-pro | OpenAI | 12.4 | 150 | 600 | — |
| 325 | Mercury 2.5 | Inception | 12.3 | 0.040 | 0.150 | 0.0040 |
| 326 | JT-MINI | China Mobile | 12.2 | — | — | — |
| 327 | Grok 3 | SpaceXAI | 12.1 | — | — | — |
| 328 | Seed-OSS-36B-Instruct | ByteDance Seed | 12.1 | — | — | — |
| 329 | Qwen3 235B A22B 2507 Instruct | Alibaba | 12 | — | — | — |
| 330 | Qwen3 Coder 480B A35B Instruct | Alibaba | 11.9 | — | — | — |
| 331 | Qwen3 VL 32B (Reasoning) | Alibaba | 11.9 | — | — | — |
| 332 | Sonar Reasoning Pro | Perplexity | 11.8 | 2.00 | 8.00 | — |
| 333 | Nova 2.0 Lite (low) | Amazon | 11.8 | — | — | — |
| 334 | Magistral Medium 1.2 | Mistral | 11.8 | — | — | — |
| 335 | HyperNova 60B 2605 (high, based on gpt-oss-120b) | Multiverse Computing | 11.7 | — | — | — |
| 336 | Gemini 2.5 Flash Preview (Reasoning) | 11.7 | 0.300 | 2.50 | 0.030 | |
| 337 | Nemotron Cascade 2 30B A3B | NVIDIA | 11.7 | — | — | — |
| 338 | MiniMax M1 80k | MiniMax | 11.7 | 0.400 | 2.20 | — |
| 339 | GPT-5.4 nano (Non-Reasoning) | OpenAI | 11.7 | 0.200 | 1.25 | 0.020 |
| 340 | gpt-oss-120b (high) | OpenAI | 11.6 | 0.150 | 0.600 | 0.075 |
| 341 | K2 Think V2 | Institute of Foundation Models | 11.5 | — | — | — |
| 342 | LongCat Flash Lite | LongCat | 11.5 | — | — | — |
| 343 | o1-preview | OpenAI | 11.4 | 15.0 | 60.0 | 7.50 |
| 344 | DeepSeek R1 (Jan '25) | DeepSeek | 11.4 | 0.500 | 2.15 | 0.350 |
| 345 | HyperCLOVA X SEED Think (32B) | Naver | 11.4 | — | — | — |
| 346 | GPT-5 (minimal) | OpenAI | 11.4 | 1.25 | 10.0 | 0.125 |
| 347 | Mistral Small 4 (Reasoning) | Mistral | 11.3 | — | — | — |
| 348 | Grok 4.1 Fast (Non-reasoning) | SpaceXAI | 11.3 | — | — | — |
| 349 | K-EXAONE (Non-reasoning) | LG AI Research | 11.2 | — | — | — |
| 350 | Qwen3 Next 80B A3B (Reasoning) | Alibaba | 11.2 | 0.150 | 1.20 | — |
| 351 | GLM-4.6V (Reasoning) | Z AI | 11.2 | 0.300 | 0.900 | 0.055 |
| 352 | Grok 4 Fast (Non-reasoning) | SpaceXAI | 11.1 | — | — | — |
| 353 | GLM-4.5-Air | Z AI | 11.1 | 0.130 | 0.850 | 0.025 |
| 354 | Granite 4.2 8B | IBM | 11.1 | 0.060 | 0.250 | 0.015 |
| 355 | GPT-5.4 mini (Non-Reasoning) | OpenAI | 11.1 | 0.750 | 4.50 | 0.075 |
| 356 | Nova 2.0 Omni (low) | Amazon | 11.1 | — | — | — |
| 357 | o3-mini (high) | OpenAI | 11 | 1.10 | 4.40 | 0.550 |
| 358 | Mi:dm K 2.5 Pro | Korea Telecom | 11 | — | — | — |
| 359 | Ring-1T | InclusionAI | 10.9 | — | — | — |
| 360 | G9v3-3B | AI9Stars | 10.8 | — | — | — |
| 361 | Qwen3.5 4B (Non-reasoning) | Alibaba | 10.8 | — | — | — |
| 362 | Trinity Large Thinking | Arcee AI | 10.8 | 0.250 | 0.800 | 0.060 |
| 363 | INTELLECT-3 (based on GLM-4.5-Air) | Prime Intellect | 10.6 | — | — | — |
| 364 | GLM-4.7-Flash (Non-reasoning) | Z AI | 10.6 | 0.060 | 0.400 | — |
| 365 | Solar Open 100B (Reasoning) | Upstage | 10.4 | — | — | — |
| 366 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning) | 10.4 | 0.100 | 0.400 | 0.010 | |
| 367 | GPT-5 (ChatGPT) | OpenAI | 10.4 | 1.25 | 10.0 | 0.125 |
| 368 | Grok 3 Reasoning Beta | SpaceXAI | 10.4 | — | — | — |
| 369 | Nemotron 3 Nano Omni 30B A3B Reasoning | NVIDIA | 10.3 | — | — | — |
| 370 | GPT-4.1 mini | OpenAI | 10.2 | 0.400 | 1.60 | 0.100 |
| 371 | gpt-oss-120b (low) | OpenAI | 10.2 | 0.150 | 0.600 | 0.075 |
| 372 | gpt-oss-20b (low) | OpenAI | 10 | 0.018 | 0.090 | — |
| 373 | MiniMax M1 40k | MiniMax | 10 | 0.400 | 2.20 | — |
| 374 | Llama 4 Maverick | Meta | 10 | 0.188 | 0.652 | — |
| 375 | Nova 2.0 Pro Preview (Non-reasoning) | Amazon | 10 | — | — | — |
| 376 | North Mini Code | Cohere | 9.9 | — | — | — |
| 377 | Gemini 2.5 Flash (Non-reasoning) | 9.9 | 0.300 | 2.50 | 0.030 | |
| 378 | K2-V2 (high) | Institute of Foundation Models | 9.9 | — | — | — |
| 379 | GPT-5 mini (minimal) | OpenAI | 9.9 | 0.250 | 2.00 | 0.025 |
| 380 | Qwen3 VL 235B A22B Instruct | Alibaba | 9.9 | 0.210 | 1.90 | 0.100 |
| 381 | Qwen3 30B A3B 2507 (Reasoning) | Alibaba | 9.8 | 0.200 | 2.40 | — |
| 382 | o1-mini | OpenAI | 9.8 | — | — | — |
| 383 | DeepSeek V3 0324 | DeepSeek | 9.7 | — | — | — |
| 384 | Ling 2.6 Flash | InclusionAI | 9.7 | — | — | — |
| 385 | Qwen3 Next 80B A3B Instruct | Alibaba | 9.6 | 0.100 | 1.10 | 0.070 |
| 386 | GPT-4.5 (Preview) | OpenAI | 9.6 | 2.50 | 15.0 | 0.250 |
| 387 | Tri-21B-think Preview | Trillion Labs | 9.6 | — | — | — |
| 388 | Qwen3 Coder 30B A3B Instruct | Alibaba | 9.6 | 0.070 | 0.280 | — |
| 389 | Qwen3 235B A22B (Reasoning) | Alibaba | 9.5 | 0.230 | 2.30 | — |
| 390 | DiffusionGemma 26B A4B | 9.5 | — | — | — | |
| 391 | Qwen3 VL 30B A3B (Reasoning) | Alibaba | 9.5 | 0.200 | 2.40 | — |
| 392 | QwQ 32B | Alibaba | 9.5 | — | — | — |
| 393 | Gemma 4 12B (Non-reasoning) | 9.4 | — | — | — | |
| 394 | Gemini 2.0 Flash Thinking Experimental (Jan '25) | 9.4 | — | — | — | |
| 395 | Mistral Large 3 | Mistral | 9.3 | — | — | — |
| 396 | Gemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning) | 9.3 | 0.100 | 0.400 | 0.010 | |
| 397 | Mistral Medium 3.1 | Mistral | 9.2 | 0.400 | 2.00 | 0.040 |
| 398 | Ling-1T | InclusionAI | 9.2 | — | — | — |
| 399 | Motif-2-12.7B-Reasoning | Motif Technologies | 9.2 | — | — | — |
| 400 | Nova Premier | Amazon | 9.2 | — | — | — |
| 401 | Qwen3 Coder Next | Alibaba | 9.2 | 0.120 | 0.800 | 0.070 |
| 402 | Granite 4.2 3B | IBM | 9.1 | — | — | — |
| 403 | Magistral Medium 1 | Mistral | 9.1 | — | — | — |
| 404 | Solar Pro 2 (Preview) (Reasoning) | Upstage | 9.1 | — | — | — |
| 405 | Mistral Small 4 (Non-reasoning) | Mistral | 9 | — | — | — |
| 406 | gpt-oss-20b (high) | OpenAI | 9 | 0.018 | 0.090 | — |
| 407 | GPT-4o (March 2025, chatgpt-4o-latest) | OpenAI | 9 | 2.50 | 10.0 | 1.25 |
| 408 | Mistral Medium 3 | Mistral | 9 | 0.400 | 2.00 | 0.040 |
| 409 | Tri-21B-Think | Trillion Labs | 9 | — | — | — |
| 410 | Devstral Medium | Mistral | 9 | 0.400 | 2.00 | 0.040 |
| 411 | K2-V2 (medium) | Institute of Foundation Models | 9 | — | — | — |
| 412 | Llama Nemotron Super 49B v1.5 (Reasoning) | NVIDIA | 9 | — | — | — |
| 413 | Claude 3.5 Haiku | Anthropic | 8.9 | — | — | — |
| 414 | Llama 3.3 Nemotron Super 49B v1 (Reasoning) | NVIDIA | 8.9 | — | — | — |
| 415 | NVIDIA Nemotron 3 Nano 30B A3B (Reasoning) | NVIDIA | 8.9 | — | — | — |
| 416 | Gemini 2.0 Flash (Feb '25) | 8.9 | — | — | — | |
| 417 | Gemma 4 E4B (Reasoning) | 8.9 | — | — | — | |
| 418 | Qwen3 4B 2507 (Reasoning) | Alibaba | 8.8 | — | — | — |
| 419 | Sarvam 105B (high) | Sarvam | 8.8 | — | — | — |
| 420 | MiniCPM5-1B (Reasoning) | OpenBMB | 8.8 | — | — | — |
| 421 | Sonar Reasoning | Perplexity | 8.7 | — | — | — |
| 422 | Gemini 2.5 Flash Preview (Non-reasoning) | 8.7 | 0.300 | 2.50 | 0.030 | |
| 423 | Nova 2.0 Lite (Non-reasoning) | Amazon | 8.7 | — | — | — |
| 424 | Claude 3 Opus | Anthropic | 8.7 | — | — | — |
| 425 | Gemini 2.0 Pro Experimental (Feb '25) | 8.7 | — | — | — | |
| 426 | Devstral Small (May '25) | Mistral | 8.7 | — | — | — |
| 427 | MiniCPM5-1B (Non-reasoning) | OpenBMB | 8.7 | — | — | — |
| 428 | Devstral 2 | Mistral | 8.6 | — | — | — |
| 429 | Magistral Small 1.2 | Mistral | 8.6 | — | — | — |
| 430 | Qwen3 32B (Reasoning) | Alibaba | 8.6 | 0.080 | 0.280 | — |
| 431 | DeepSeek V3 (Dec '24) | DeepSeek | 8.5 | — | — | — |
| 432 | Gemini 2.5 Flash-Lite (Reasoning) | 8.5 | 0.100 | 0.400 | 0.010 | |
| 433 | GLM-4.6V (Non-reasoning) | Z AI | 8.4 | 0.300 | 0.900 | 0.055 |
| 434 | Qwen3 VL 32B Instruct | Alibaba | 8.4 | 0.104 | 0.416 | — |
| 435 | Nanbeige4.1-3B | Nanbeige | 8.4 | — | — | — |
| 436 | GPT-4o (Nov '24) | OpenAI | 8.4 | 2.50 | 10.0 | 1.25 |
| 437 | DeepSeek R1 Distill Qwen 32B | DeepSeek | 8.4 | — | — | — |
| 438 | LFM2.5-2.6B | Liquid AI | 8.4 | — | — | — |
| 439 | Qwen3 235B A22B (Non-reasoning) | Alibaba | 8.3 | 0.230 | 2.30 | — |
| 440 | Magistral Small 1 | Mistral | 8.2 | — | — | — |
| 441 | Nova 2.0 Omni (Non-reasoning) | Amazon | 8.2 | — | — | — |
| 442 | Mistral Small 3.2 | Mistral | 8.2 | — | — | — |
| 443 | EXAONE 4.0 32B (Reasoning) | LG AI Research | 8.2 | — | — | — |
| 444 | Qwen3 14B (Reasoning) | Alibaba | 8.2 | 0.120 | 0.240 | — |
| 445 | Qwen3 VL 8B (Reasoning) | Alibaba | 8.2 | 0.180 | 2.10 | — |
| 446 | Gemini 2.0 Flash (experimental) | 8.2 | — | — | — | |
| 447 | DeepSeek R1 0528 Qwen3 8B | DeepSeek | 8.1 | — | — | — |
| 448 | Llama 4 Scout | Meta | 8.1 | 0.100 | 0.300 | — |
| 449 | Qwen2.5 Max | Alibaba | 8 | — | — | — |
| 450 | Claude 3.5 Sonnet (Oct '24) | Anthropic | 7.9 | — | — | — |
| 451 | Gemini 1.5 Pro (Sep '24) | 7.9 | — | — | — | |
| 452 | Solar Pro 2 (Preview) (Non-reasoning) | Upstage | 7.9 | — | — | — |
| 453 | DeepSeek R1 Distill Llama 70B | DeepSeek | 7.9 | 0.800 | 0.800 | — |
| 454 | Qwen3 VL 30B A3B Instruct | Alibaba | 7.9 | 0.150 | 0.600 | — |
| 455 | Hermes 4 - Llama-3.1 70B (Reasoning) | Nous Research | 7.9 | — | — | — |
| 456 | GPT-4.1 nano | OpenAI | 7.8 | 0.100 | 0.400 | 0.025 |
| 457 | Ling-flash-2.0 | InclusionAI | 7.8 | — | — | — |
| 458 | Gemma 4 E2B (Reasoning) | 7.8 | — | — | — | |
| 459 | DeepSeek R1 Distill Qwen 14B | DeepSeek | 7.8 | — | — | — |
| 460 | Solar Pro 3 | Upstage | 7.8 | 0.150 | 0.600 | 0.015 |
| 461 | Qwen3 Omni 30B A3B (Reasoning) | Alibaba | 7.8 | — | — | — |
| 462 | Falcon-H1R-7B | TII UAE | 7.8 | — | — | — |
| 463 | Sonar | Perplexity | 7.7 | 1.00 | 1.00 | — |
| 464 | GPT-4o (Aug '24) | OpenAI | 7.7 | 2.50 | 10.0 | 1.25 |
| 465 | Llama 3.3 Instruct 70B | Meta | 7.7 | 0.100 | 0.320 | — |
| 466 | Step3 VL 10B | StepFun | 7.7 | — | — | — |
| 467 | Qwen2.5 Instruct 72B | Alibaba | 7.7 | — | — | — |
| 468 | GLM-4.5V (Reasoning) | Z AI | 7.6 | 0.600 | 1.80 | 0.110 |
| 469 | Sonar Pro | Perplexity | 7.6 | 3.00 | 15.0 | — |
| 470 | Qwen3 30B A3B (Reasoning) | Alibaba | 7.6 | 0.200 | 2.40 | — |
| 471 | Mistral Large 2 (Nov '24) | Mistral | 7.6 | — | — | — |
| 472 | QwQ 32B-Preview | Alibaba | 7.6 | — | — | — |
| 473 | Devstral Small (Jul '25) | Mistral | 7.6 | — | — | — |
| 474 | Gemma 4 E4B (Non-reasoning) | 7.5 | — | — | — | |
| 475 | NVIDIA Nemotron Nano 12B v2 VL (Reasoning) | NVIDIA | 7.5 | — | — | — |
| 476 | Qwen3 30B A3B 2507 Instruct | Alibaba | 7.5 | 0.100 | 0.300 | — |
| 477 | Hermes 4 - Llama-3.1 405B (Reasoning) | Nous Research | 7.5 | — | — | — |
| 478 | ERNIE 4.5 300B A47B | Baidu | 7.5 | — | — | — |
| 479 | Devstral Small 2 | Mistral | 7.5 | — | — | — |
| 480 | Llama 3.1 Nemotron Ultra 253B v1 (Reasoning) | NVIDIA | 7.5 | — | — | — |
| 481 | Solar Pro 2 (Reasoning) | Upstage | 7.5 | — | — | — |
| 482 | Llama Nemotron Super 49B v1.5 (Non-reasoning) | NVIDIA | 7.4 | — | — | — |
| 483 | Gemini 2.0 Flash-Lite (Feb '25) | 7.4 | — | — | — | |
| 484 | NVIDIA Nemotron 3 Nano 4B | NVIDIA | 7.4 | — | — | — |
| 485 | Hermes 4 - Llama-3.1 405B (Non-reasoning) | Nous Research | 7.4 | — | — | — |
| 486 | Granite 4.1 30B | IBM | 7.4 | — | — | — |
| 487 | NVIDIA Nemotron Nano 9B V2 (Reasoning) | NVIDIA | 7.4 | — | — | — |
| 488 | Qwen3 VL 8B Instruct | Alibaba | 7.3 | 0.117 | 0.455 | — |
| 489 | Gemini 2.0 Flash-Lite (Preview) | 7.3 | — | — | — | |
| 490 | Llama 3.1 Instruct 405B | Meta | 7.3 | — | — | — |
| 491 | Kimi Linear 48B A3B Instruct | Kimi | 7.3 | — | — | — |
| 492 | Qwen3 8B (Reasoning) | Alibaba | 7.3 | 0.117 | 0.455 | — |
| 493 | Llama 3.1 Nemotron Nano 4B v1.1 (Reasoning) | NVIDIA | 7.3 | — | — | — |
| 494 | Qwen3 32B (Non-reasoning) | Alibaba | 7.3 | 0.080 | 0.280 | — |
| 495 | Llama 3.3 Nemotron Super 49B v1 (Non-reasoning) | NVIDIA | 7.3 | — | — | — |
| 496 | K2-V2 (low) | Institute of Foundation Models | 7.3 | — | — | — |
| 497 | GPT-4o (May '24) | OpenAI | 7.3 | 2.50 | 10.0 | 1.25 |
| 498 | Qwen3 4B (Reasoning) | Alibaba | 7.2 | — | — | — |
| 499 | Ring-flash-2.0 | InclusionAI | 7.2 | — | — | — |
| 500 | Claude 3.5 Sonnet (June '24) | Anthropic | 7.2 | — | — | — |
| 501 | GPT-4o (ChatGPT) | OpenAI | 7.2 | 2.50 | 10.0 | 1.25 |
| 502 | LFM2.5-8B-A1B | Liquid AI | 7.2 | — | — | — |
| 503 | Llama 3.1 Tulu3 405B | Allen Institute for AI | 7.2 | — | — | — |
| 504 | GPT-5 nano (minimal) | OpenAI | 7.1 | 0.050 | 0.400 | 0.0050 |
| 505 | Mistral Small 3.1 | Mistral | 7.1 | — | — | — |
| 506 | Grok 2 (Dec '24) | SpaceXAI | 7.1 | — | — | — |
| 507 | Olmo 3.1 32B Think | Allen Institute for AI | 7.1 | — | — | — |
| 508 | Gemini 1.5 Flash (Sep '24) | 7.1 | — | — | — | |
| 509 | Pixtral Large | Mistral | 7.1 | — | — | — |
| 510 | Command A | Cohere | 7 | 2.50 | 10.0 | — |
| 511 | Solar Pro 2 (Non-reasoning) | Upstage | 7 | — | — | — |
| 512 | Nova Pro | Amazon | 7 | — | — | — |
| 513 | GPT-4 Turbo | OpenAI | 7 | 10.0 | 30.0 | — |
| 514 | Qwen3 VL 4B (Reasoning) | Alibaba | 7 | — | — | — |
| 515 | Qwen2.5 Instruct 32B | Alibaba | 6.9 | — | — | — |
| 516 | Qwen3.5 2B (Reasoning) | Alibaba | 6.9 | — | — | — |
| 517 | Llama 3.1 Nemotron Instruct 70B | NVIDIA | 6.9 | — | — | — |
| 518 | Llama 3.1 Instruct 8B | Meta | 6.9 | 0.050 | 0.080 | 0.025 |
| 519 | Grok Beta | SpaceXAI | 6.9 | 1.60 | 4.80 | 0.400 |
| 520 | Mistral Large 2 (Jul '24) | Mistral | 6.8 | — | — | — |
| 521 | NVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning) | NVIDIA | 6.8 | — | — | — |
| 522 | NVIDIA Nemotron Nano 9B V2 (Non-reasoning) | NVIDIA | 6.8 | — | — | — |
| 523 | GLM-4.5V (Non-reasoning) | Z AI | 6.7 | 0.600 | 1.80 | 0.110 |
| 524 | Qwen2.5 Coder Instruct 32B | Alibaba | 6.7 | — | — | — |
| 525 | Gemini 2.5 Flash-Lite (Non-reasoning) | 6.7 | 0.100 | 0.400 | 0.010 | |
| 526 | Hermes 4 - Llama-3.1 70B (Non-reasoning) | Nous Research | 6.7 | — | — | — |
| 527 | Nova Lite | Amazon | 6.7 | — | — | — |
| 528 | GPT-4 | OpenAI | 6.7 | 30.0 | 60.0 | — |
| 529 | Qwen3 4B 2507 Instruct | Alibaba | 6.7 | — | — | — |
| 530 | GPT-4o mini | OpenAI | 6.7 | 0.150 | 0.600 | 0.075 |
| 531 | Mistral Small 3 | Mistral | 6.7 | — | — | — |
| 532 | Qwen3 14B (Non-reasoning) | Alibaba | 6.7 | 0.120 | 0.240 | — |
| 533 | Llama 3.1 Instruct 70B | Meta | 6.6 | 0.400 | 0.400 | — |
| 534 | Sarvam 30B (high) | Sarvam | 6.6 | — | — | — |
| 535 | Granite 4.1 8B | IBM | 6.6 | — | — | — |
| 536 | DeepSeek-V2.5 | DeepSeek | 6.6 | — | — | — |
| 537 | DeepSeek-V2.5 (Dec '24) | DeepSeek | 6.6 | — | — | — |
| 538 | Gemini 2.0 Flash Thinking Experimental (Dec '24) | 6.6 | — | — | — | |
| 539 | Qwen3 4B (Non-reasoning) | Alibaba | 6.6 | — | — | — |
| 540 | Qwen3 30B A3B (Non-reasoning) | Alibaba | 6.6 | 0.200 | 2.40 | — |
| 541 | DeepSeek R1 Distill Llama 8B | DeepSeek | 6.5 | — | — | — |
| 542 | Gemma 4 E2B (Non-reasoning) | 6.5 | — | — | — | |
| 543 | Mistral Saba | Mistral | 6.5 | 0.200 | 0.600 | 0.020 |
| 544 | Olmo 3.1 32B Instruct | Allen Institute for AI | 6.5 | — | — | — |
| 545 | Olmo 3 32B Think | Allen Institute for AI | 6.5 | — | — | — |
| 546 | Gemini 1.5 Pro (May '24) | 6.4 | — | — | — | |
| 547 | Qwen2.5 Turbo | Alibaba | 6.4 | — | — | — |
| 548 | R1 1776 | Perplexity | 6.4 | — | — | — |
| 549 | Llama 3.2 Instruct 90B (Vision) | Meta | 6.4 | — | — | — |
| 550 | Reka Flash (Sep '24) | Reka AI | 6.4 | — | — | — |
| 551 | Solar Mini | Upstage | 6.4 | — | — | — |
| 552 | EXAONE 4.0 32B (Non-reasoning) | LG AI Research | 6.3 | — | — | — |
| 553 | Grok-1 | SpaceXAI | 6.3 | — | — | — |
| 554 | Qwen2 Instruct 72B | Alibaba | 6.3 | — | — | — |
| 555 | Celeris-1 | Celeris | 6.3 | — | — | — |
| 556 | Phi-4 Mini Instruct | Microsoft | 6.3 | — | — | — |
| 557 | Qwen3.5 2B (Non-reasoning) | Alibaba | 6.2 | — | — | — |
| 558 | Gemini 1.5 Flash-8B | 6.2 | — | — | — | |
| 559 | Jamba 1.7 Large | AI21 Labs | 6.1 | — | — | — |
| 560 | Qwen3.5 0.8B (Reasoning) | Alibaba | 6.1 | — | — | — |
| 561 | DeepHermes 3 - Mistral 24B Preview (Non-reasoning) | Nous Research | 6.1 | — | — | — |
| 562 | Qwen3 Omni 30B A3B Instruct | Alibaba | 6 | — | — | — |
| 563 | Hermes 3 - Llama-3.1 70B | Nous Research | 6 | 0.700 | 0.700 | — |
| 564 | OLMo 2 32B | Allen Institute for AI | 6 | — | — | — |
| 565 | Granite 4.0 H Small | IBM | 6 | — | — | — |
| 566 | Ministral 3 14B | Mistral | 6 | — | — | — |
| 567 | DeepSeek-Coder-V2 | DeepSeek | 6 | — | — | — |
| 568 | Jamba 1.6 Large | AI21 Labs | 6 | — | — | — |
| 569 | Qwen3 8B (Non-reasoning) | Alibaba | 6 | 0.117 | 0.455 | — |
| 570 | Jamba 1.5 Large | AI21 Labs | 6 | — | — | — |
| 571 | Nova Micro | Amazon | 5.9 | — | — | — |
| 572 | Granite 4.1 3B | IBM | 5.9 | — | — | — |
| 573 | Gemini 1.5 Flash (May '24) | 5.9 | — | — | — | |
| 574 | Claude 3 Sonnet | Anthropic | 5.9 | — | — | — |
| 575 | Phi-4 | Microsoft | 5.9 | 0.070 | 0.140 | — |
| 576 | LFM2 24B A2B | Liquid AI | 5.9 | — | — | — |
| 577 | Gemini 1.0 Ultra | 5.8 | — | — | — | |
| 578 | Phi-4 Multimodal Instruct | Microsoft | 5.8 | — | — | — |
| 579 | Mistral Large (Feb '24) | Mistral | 5.8 | 0.500 | 1.50 | 0.050 |
| 580 | Mistral Small (Sep '24) | Mistral | 5.8 | 0.150 | 0.600 | 0.015 |
| 581 | NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) | NVIDIA | 5.8 | — | — | — |
| 582 | Gemma 3n E4B Instruct Preview (May '25) | 5.8 | — | — | — | |
| 583 | Phi-3 Mini Instruct 3.8B | Microsoft | 5.8 | — | — | — |
| 584 | Qwen2.5 Coder Instruct 7B | Alibaba | 5.8 | — | — | — |
| 585 | MiniCPM-V 4.6 1.3B | OpenBMB | 5.7 | — | — | — |
| 586 | Llama 3.2 Instruct 3B | Meta | 5.7 | 0.050 | 0.330 | — |
| 587 | Mixtral 8x22B Instruct | Mistral | 5.7 | 2.00 | 6.00 | 0.200 |
| 588 | Qwen1.5 Chat 110B | Alibaba | 5.7 | — | — | — |
| 589 | Qwen3 VL 4B Instruct | Alibaba | 5.7 | — | — | — |
| 590 | Jamba Reasoning 3B | AI21 Labs | 5.7 | — | — | — |
| 591 | Llama 2 Chat 7B | Meta | 5.7 | — | — | — |
| 592 | Claude 3 Haiku | Anthropic | 5.6 | — | — | — |
| 593 | Olmo 3 7B Think | Allen Institute for AI | 5.6 | — | — | — |
| 594 | Claude 2.1 | Anthropic | 5.6 | — | — | — |
| 595 | Molmo 7B-D | Allen Institute for AI | 5.6 | — | — | — |
| 596 | Reka Flash 3 | Reka AI | 5.6 | 0.100 | 0.200 | — |
| 597 | OLMo 2 7B | Allen Institute for AI | 5.6 | — | — | — |
| 598 | GPT-3.5 Turbo | OpenAI | 5.5 | 1.00 | 2.00 | — |
| 599 | Mistral Medium | Mistral | 5.5 | — | — | — |
| 600 | DeepSeek-V2-Chat | DeepSeek | 5.5 | — | — | — |
| 601 | Mistral Small (Feb '24) | Mistral | 5.5 | 0.150 | 0.600 | 0.015 |
| 602 | Ling-mini-2.0 | InclusionAI | 5.5 | — | — | — |
| 603 | DeepSeek R1 Distill Qwen 1.5B | DeepSeek | 5.5 | — | — | — |
| 604 | Ministral 3 8B | Mistral | 5.5 | — | — | — |
| 605 | Llama 3 Instruct 70B | Meta | 5.5 | — | — | — |
| 606 | Claude 2.0 | Anthropic | 5.5 | — | — | — |
| 607 | LFM 40B | Liquid AI | 5.4 | — | — | — |
| 608 | Qwen3.5 0.8B (Non-reasoning) | Alibaba | 5.4 | — | — | — |
| 609 | Qwen Chat 72B | Alibaba | 5.4 | — | — | — |
| 610 | PALM-2 | 5.4 | — | — | — | |
| 611 | Llama 3.2 Instruct 11B (Vision) | Meta | 5.4 | — | — | — |
| 612 | Arctic Instruct | Snowflake | 5.4 | — | — | — |
| 613 | DBRX Instruct | Databricks | 5.3 | — | — | — |
| 614 | Sarvam M (Reasoning, based on Mistral Small 3.1) | Sarvam | 5.3 | — | — | — |
| 615 | Llama 2 Chat 70B | Meta | 5.3 | — | — | — |
| 616 | Llama 2 Chat 13B | Meta | 5.3 | — | — | — |
| 617 | Command-R+ (Apr '24) | Cohere | 5.3 | — | — | — |
| 618 | DeepSeek LLM 67B Chat (V1) | DeepSeek | 5.3 | — | — | — |
| 619 | Gemini 1.0 Pro | 5.3 | — | — | — | |
| 620 | DeepSeek Coder V2 Lite Instruct | DeepSeek | 5.3 | — | — | — |
| 621 | Exaone 4.0 1.2B (Reasoning) | LG AI Research | 5.3 | — | — | — |
| 622 | OpenChat 3.5 (1210) | OpenChat | 5.3 | — | — | — |
| 623 | LFM2.5-1.2B-Instruct | Liquid AI | 5.2 | — | — | — |
| 624 | Jamba 1.5 Mini | AI21 Labs | 5.2 | — | — | — |
| 625 | Qwen3 1.7B (Reasoning) | Alibaba | 5.2 | — | — | — |
| 626 | LFM2.5-1.2B-Thinking | Liquid AI | 5.2 | — | — | — |
| 627 | LFM2 2.6B | Liquid AI | 5.2 | — | — | — |
| 628 | Exaone 4.0 1.2B (Non-reasoning) | LG AI Research | 5.2 | — | — | — |
| 629 | Olmo 3 7B Instruct | Allen Institute for AI | 5.2 | — | — | — |
| 630 | Jamba 1.7 Mini | AI21 Labs | 5.2 | — | — | — |
| 631 | Granite 4.0 H 1B | IBM | 5.2 | — | — | — |
| 632 | Jamba 1.6 Mini | AI21 Labs | 5.2 | — | — | — |
| 633 | Gemma 3 270M | 5.1 | — | — | — | |
| 634 | Granite 4.0 Micro | IBM | 5.1 | — | — | — |
| 635 | Mixtral 8x7B Instruct | Mistral | 5.1 | — | — | — |
| 636 | Apertus 70B Instruct | Swiss AI Initiative | 5.1 | — | — | — |
| 637 | DeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning) | Nous Research | 5.1 | — | — | — |
| 638 | Mistral 7B Instruct | Mistral | 5 | — | — | — |
| 639 | Molmo2-8B | Allen Institute for AI | 5 | — | — | — |
| 640 | Claude Instant | Anthropic | 5 | — | — | — |
| 641 | Granite 4.0 1B | IBM | 5 | — | — | — |
| 642 | Command-R (Mar '24) | Cohere | 5 | — | — | — |
| 643 | Qwen Chat 14B | Alibaba | 5 | — | — | — |
| 644 | Llama 65B | Meta | 5 | — | — | — |
| 645 | Qwen3 1.7B (Non-reasoning) | Alibaba | 4.9 | — | — | — |
| 646 | Gemma 3 27B Instruct | 4.9 | — | — | — | |
| 647 | Granite 3.3 8B (Non-reasoning) | IBM | 4.9 | — | — | — |
| 648 | LFM2 8B A1B | Liquid AI | 4.9 | — | — | — |
| 649 | Qwen3 0.6B (Non-reasoning) | Alibaba | 4.8 | — | — | — |
| 650 | LFM2 1.2B | Liquid AI | 4.8 | — | — | — |
| 651 | Gemma 3 4B Instruct | 4.8 | — | — | — | |
| 652 | LFM2.5-VL-1.6B | Liquid AI | 4.8 | — | — | — |
| 653 | Qwen3 0.6B (Reasoning) | Alibaba | 4.8 | — | — | — |
| 654 | Granite 4.0 350M | IBM | 4.8 | — | — | — |
| 655 | Ministral 3 3B | Mistral | 4.8 | — | — | — |
| 656 | Llama 3.2 Instruct 1B | Meta | 4.8 | 0.027 | 0.201 | — |
| 657 | Tiny Aya Global | Cohere | 4.8 | — | — | — |
| 658 | Llama 3 Instruct 8B | Meta | 4.8 | — | — | — |
| 659 | Apertus 8B Instruct | Swiss AI Initiative | 4.8 | — | — | — |
| 660 | Granite 4.0 H 350M | IBM | 4.8 | — | — | — |
| 661 | Gemma 3n E4B Instruct | 4.8 | — | — | — | |
| 662 | Gemma 3n E2B Instruct | 4.8 | — | — | — | |
| 663 | Gemma 3 1B Instruct | 4.8 | — | — | — | |
| 664 | Gemma 3 12B Instruct | 3.8 | — | — | — | |
| 665 | K2 Horizon 0.9B | Institute of Foundation Models | 3 | — | — | — |
Source: Artificial Analysis · Updated Sep 28, 2026 · PandaNpc Updated Sep 28, 2026, 06:00 UTCView full leaderboard →
How to read these numbers
An LLM leaderboard tells you which model people prefer; an AI benchmark tells you what a model can objectively do; usage data tells you what developers actually ship. No single ranking answers "which is the best AI model", so this page aggregates all three — Chatbot Arena Elo from arena.ai, the Artificial Analysis Intelligence Index and speech arenas, and OpenRouter token share — and refreshes them daily.
arena.ai (formerly LMArena) shows users two anonymous answers to the same prompt and asks them to pick one, then derives an Elo rating from those battles. It measures which answer people prefer — not objective capability. A likeable style can win, while a rigorous but verbose answer can lose.
Votes are the battles a model has accumulated. A newly listed model has few votes and a wide confidence interval, so its rank swings easily — always read the rank together with the ± interval.
The Agent board works differently from the rest: it measures real agent sessions rather than blind-vote preference. Its headline metric, Net Improvement, is a percentage gain — not an Elo rating — so it cannot be compared across boards. arena.ai also reports five more dimensions (Confirmed Success, Steerability, Bash Recovery and others) on the full leaderboard.
The usage board comes from OpenRouter and counts real API token share — developers voting with their wallets, which complements the subjective preference boards.
The speech boards come from Artificial Analysis: TTS uses blind-listening Speech Arena Elo; ASR uses AA-WER v2, where lower is better; and native Speech-to-Speech uses an equal-weight composite of Big Bench Audio, Full Duplex Bench and τ-Voice, where higher is better. Compare scores only within the same board. Source: artificialanalysis.ai.
The Intelligence Index board comes from Artificial Analysis: it distills many public benchmarks into a single 0-100 Intelligence Index, measuring objective capability rather than subjective preference — a natural complement to arena.ai's human blind vote. Source: artificialanalysis.ai.