LLM Leaderboard & AI Model Rankings

One page that aggregates the major AI benchmarks and leaderboards — Chatbot Arena Elo (arena.ai), the Artificial Analysis Intelligence Index and speech arenas, and OpenRouter usage — across chat, coding, TTS, speech-to-text, image, video and agents.

RankModelVendorIntelligence Index ?Input ?OutputCache ?
1AnthropicClaude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic57.64.0020.00.200
2AnthropicClaude Opus 5.5 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic564.0020.00.200
3AnthropicClaude Opus 5.5 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic53.64.0020.00.200
4AnthropicClaude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic53.410.050.00.250
5AnthropicClaude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53.210.050.00.250
6OpenAIGPT-6 Astra (max)OpenAI52.710.050.01.00
7OpenAIGPT-6 Astra (xhigh)OpenAI52.410.050.01.00
8AnthropicClaude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51.210.050.00.250
9AnthropicClaude Opus 5.5 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic51.24.0020.00.200
10OpenAIGPT-6 Astra (high)OpenAI50.910.050.01.00
11AnthropicClaude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic50.85.0025.00.500
12AnthropicClaude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic49.75.0025.00.500
13AnthropicClaude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic49.610.050.01.00
14OpenAIGPT-6 Astra (medium)OpenAI49.610.050.01.00
15AnthropicClaude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic48.910.050.00.250
16AnthropicClaude Opus 5 (Adaptive Reasoning, High Effort)Anthropic48.15.0025.00.500
17MetaMuse Spark 1.3 (max)Meta48.11.254.250.150
18OpenAIGPT-6 Sol (max)OpenAI47.52.0010.00.200
19OpenAIGPT-5.6 Sol (max)OpenAI472.0010.00.200
20AnthropicClaude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic46.810.050.00.250
21SpaceXAIGrok 4.7 (xhigh)SpaceXAI46.41.604.800.400
22XiaomiMiMo-V2.6-ProXiaomi46.30.4350.8700.0036
23SpaceXAIGrok 4.7 (high)SpaceXAI46.31.604.800.400
24OpenAIGPT-6 Astra (low)OpenAI45.810.050.01.00
25AlibabaQwen3.8 Max (0902)Alibaba45.42.006.000.250
26MetaMuse Spark 1.3 (xhigh)Meta45.11.254.250.150
27Z AIGLM-5.3 (max)Z AI44.80.3301.200.084
28AnthropicClaude Opus 5 (Adaptive Reasoning, Medium Effort)Anthropic44.85.0025.00.500
29SpaceXAIGrok 4.6 (high)SpaceXAI44.32.006.000.500
30SpaceXAIGrok 4.6 (xhigh)SpaceXAI44.22.006.000.500
31OpenAIGPT-6 Sol (xhigh)OpenAI44.12.0010.00.200
32OpenAIGPT-5.6 Sol (xhigh)OpenAI442.0010.00.200
33StepFunStep 5 PreviewStepFun43.7———
34KimiKimi K3 (max)Kimi43.63.0015.00.300
35SpaceXAIGrok 4.6 (medium)SpaceXAI42.82.006.000.500
36OpenAIGPT-6 Sol (high)OpenAI42.82.0010.00.200
37AnthropicClaude Opus 5.5 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic42.34.0020.00.200
38OpenAIGPT-5.6 Sol (high)OpenAI42.32.0010.00.200
39OpenAIGPT-5.6 Terra (max)OpenAI42.12.0012.00.200
40Z AIGLM 5.3 FlashZ AI41.80.1500.5000.030
41AnthropicClaude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic41.85.0025.00.500
42GoogleGemini 3.8 Flash (high)Google40.90.7503.750.075
43AnthropicClaude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic40.75.0025.00.500
44AlibabaQwen3.8 MaxAlibaba40.22.006.000.250
45AlibabaQwen3.8 2.4T A95BAlibaba39.92.006.000.250
46GoogleGemini 3.8 Flash (medium)Google39.80.7503.750.075
47OpenAIGPT-6 Sol (medium)OpenAI39.82.0010.00.200
48AlibabaQwen3.8-Flash-NextAlibaba39.8———
49MetaMuse Spark 1.2 (xhigh)Meta39.61.254.250.150
50GoogleGemini 3.7 Flash (medium)Google39.60.7503.750.075
51DeepSeekDeepSeek V4.1 Flash (Reasoning, Max Effort)DeepSeek39.50.0300.6000.0060
52AnthropicClaude Opus 5 (Adaptive Reasoning, Low Effort)Anthropic39.45.0025.00.500
53OpenAIGPT-5.6 Sol (medium)OpenAI39.22.0010.00.200
54GoogleGemini 3.7 Flash (high)Google39.10.7503.750.075
55OpenAIGPT-5.4 (xhigh)OpenAI392.5015.00.250
56SpaceXAIGrok 4.5 (high)SpaceXAI38.82.006.000.300
57OpenAIGPT-5.5 (xhigh)OpenAI38.45.0030.00.500
58AnthropicClaude Sonnet 5 (Adaptive Reasoning, Max Effort)Anthropic38.22.0010.00.200
59OpenAIGPT-5.6 Terra (xhigh)OpenAI382.0012.00.200
60XiaomiMiMo-V2.6-FlashXiaomi37.90.1400.2800.0028
61OpenAIGPT-5.6 Luna (max)OpenAI37.30.2001.200.020
62OpenAIGPT-6 Luna (max)OpenAI37.30.1000.5000.010
63OpenAIGPT-5.5 (high)OpenAI375.0030.00.500
64GoogleGemini 3.7 Flash (low)Google36.90.7503.750.075
65DeepSeekDeepSeek V4 Pro 0813 (Reasoning, Max Effort)DeepSeek360.2524.200.252
66SpaceXAIGrok 4.6 (low)SpaceXAI35.12.006.000.500
67DeepSeekDeepSeek V4 Flash Vision (Reasoning, Max Effort)DeepSeek34.80.4401.320.014
68OpenAIGPT-5.6 Luna (xhigh)OpenAI34.60.2001.200.020
69KimiKimi K3 (low)Kimi34.53.0015.00.300
70AnthropicClaude Sonnet 5 (Adaptive Reasoning, Xhigh Effort)Anthropic34.42.0010.00.200
71Z AIGLM-5.3 (low)Z AI34.30.3301.200.084
72DeepSeekDeepSeek V4 Flash 0731 (Reasoning, Max Effort)DeepSeek34.30.0210.3200.016
73OpenAIGPT-5.6 Terra (high)OpenAI34.22.0012.00.200
74GoogleGemini 3.6 Flash (high)Google340.7503.750.075
75OpenAIGPT-6 Sol (low)OpenAI33.92.0010.00.200
76OpenAIGPT-6 Luna (xhigh)OpenAI33.90.1000.5000.010
77OpenAIGPT-5.5 (medium)OpenAI33.85.0030.00.500
78AlibabaQwen3.8 27B (xhigh)Alibaba33.70.4203.000.085
79MetaMuse Spark 1.1 (xhigh)Meta33.71.254.250.150
80Z AIGLM-5.2 (max)Z AI33.70.6502.040.121
81GoogleGemini 3.5 Flash (medium)Google33.61.509.000.150
82MMotif 3Motif Technologies33.6———
83OpenAIGPT-5.6 Sol (low)OpenAI33.52.0010.00.200
84GoogleGemini 3.8 Flash (low)Google33.50.7503.750.075
85GoogleGemini 3.5 Flash (high)Google32.61.509.000.150
86OpenAIGPT-5.3 Codex (xhigh)OpenAI32.51.7514.00.175
87MMotif 3 (Beta)Motif Technologies32.3———
88OpenAIGPT-6 Luna (high)OpenAI32.10.1000.5000.010
89OpenAIGPT-5.6 Luna (high)OpenAI32.10.2001.200.020
90AnthropicClaude Opus 4.6 (Adaptive Reasoning, Max Effort)Anthropic31.95.0025.00.500
91AnthropicClaude Sonnet 5 (Adaptive Reasoning, High Effort)Anthropic31.72.0010.00.200
92MetaMuse SparkMeta31.3———
93AnthropicClaude Opus 4.7 (Non-reasoning, High Effort)Anthropic30.95.0025.00.500
94OpenAIGPT-5.5 (low)OpenAI30.75.0030.00.500
95IK2 Horizon 375B A23BInstitute of Foundation Models30.5———
96OpenAIGPT-5.2 (xhigh)OpenAI30.41.7514.00.175
97DeepSeekDeepSeek V4 Pro 0424 (Reasoning, Max Effort)DeepSeek30.40.2524.200.252
98OpenAIGPT-5.6 Terra (medium)OpenAI30.12.0012.00.200
99DeepSeekDeepSeek V4 Pro 0424 (Reasoning, High Effort)DeepSeek30.10.2524.200.252
100AnthropicClaude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic30.13.0015.00.300
101GoogleGemini 3.1 Pro PreviewGoogle29.72.0012.00.200
102OpenAIGPT-6 Luna (medium)OpenAI29.50.1000.5000.010
103AlibabaQwen3.7 MaxAlibaba29.51.484.420.295
104MiniMaxMiniMax-M3MiniMax29.20.3001.200.060
105AnthropicClaude Opus 4.5 (Reasoning)Anthropic29.15.0025.00.500
106XiaomiMiMo-V2-ProXiaomi28.6———
107OpenAIGPT-5.2 Codex (xhigh)OpenAI28.51.7514.00.175
108AlibabaQwen3.6 Max PreviewAlibaba28.41.036.16—
109OpenAIGPT-5.6 Sol (Non-reasoning)OpenAI28.32.0010.00.200
110USolar Pro 4Upstage28.2———
111NNex-N2-Pro (based on Qwen3.5-397B-A17B)Nex AGI28.2———
112OpenAIGPT-6 Sol (Non-reasoning)OpenAI28.12.0010.00.200
113AnthropicClaude Sonnet 5 (Adaptive Reasoning, Medium Effort)Anthropic28.12.0010.00.200
114GoogleGemini 3 Pro Preview (high)Google28———
115Z AIGLM-5 (Reasoning)Z AI27.90.6001.920.120
116Thinking MachinesInkling SmallThinking Machines27.80.4501.200.100
117OpenAIGPT-5.4 (low)OpenAI27.62.5015.00.250
118AlibabaQwen3.8 27B (medium)Alibaba27.60.4203.000.085
119OpenAIGPT-5.6 Terra (low)OpenAI27.52.0012.00.200
120CJT-4.1 Flash 236B A21BChina Mobile27.3———
121SpaceXAIGrok Build 0.1 0616SpaceXAI27.21.002.000.200
122KimiKimi K2.6Kimi270.6503.410.150
123AlibabaQwen3.6 PlusAlibaba270.3251.95—
124MQuasar 438B (max, based on GLM-5.2)Multiverse Computing26.7———
125Z AIGLM-5-TurboZ AI26.61.204.000.240
126OpenAIGPT-5.2 (medium)OpenAI26.51.7514.00.175
127AApodex 1.1Apodex26.4———
128AnthropicClaude Opus 4.6 (Non-reasoning, High Effort)Anthropic26.45.0025.00.500
129GoogleGemini 3 Flash Preview (Reasoning)Google26.30.5003.000.050
130AlibabaQwen3.8 27B (low)Alibaba26.20.4203.000.085
131Z AIGLM-5.1 (Reasoning)Z AI26.11.404.400.260
132XiaomiMiMo-V2.5-ProXiaomi260.4350.8700.0036
133DeepSeekDeepSeek V4 Flash 0420 (Reasoning, High Effort)DeepSeek260.0210.3200.016
134OpenAIGPT-5.5 Instant (June 2026)OpenAI265.0030.00.500
135KimiKimi K2.7 CodeKimi25.80.6563.300.180
136SpaceXAIGrok 4.20 0309 v2 (Reasoning)SpaceXAI25.7———
137IK2 Horizon MoVA 36B A4BInstitute of Foundation Models25.3———
138TencentHy3Tencent25.30.1320.5280.033
139SpaceXAIGrok 4.20 0309 (Reasoning)SpaceXAI25.21.252.500.200
140XiaomiMiMo-V2.5Xiaomi25.20.1400.2800.0028
141AlibabaQwen3.7 PlusAlibaba25.20.3201.280.064
142XiaomiMiMo-V2-Omni-0327Xiaomi25.1———
143Thinking MachinesInkling (xhigh)Thinking Machines251.004.050.170
144OpenAIGPT-5.6 Luna (medium)OpenAI250.2001.200.020
145OpenAIGPT-5 Codex (high)OpenAI24.9———
146SpaceXAIGrok 4.3 (high)SpaceXAI24.91.252.500.200
147ILing 3.0 FlashInclusionAI24.90.0210.0630.0042
148SpaceXAIGrok 4.3 (medium)SpaceXAI24.81.252.500.200
149AnthropicClaude Sonnet 4.6 (Non-reasoning, High Effort)Anthropic24.73.0015.00.300
150OpenAIGPT-5.1 (high)OpenAI24.71.2510.00.125
151DeepSeekDeepSeek V4.1 Flash (Non-Reasoning)DeepSeek24.70.0300.6000.0060
152USolar Open2 250BUpstage24.7———
153ILing-3.0-flash-VLInclusionAI24.60.0210.0620.0042
154AnthropicClaude Sonnet 5 (Adaptive Reasoning, Low Effort)Anthropic24.32.0010.00.200
155SpaceXAIGrok 4.3 (low)SpaceXAI24.31.252.500.200
156Z AIGLM-5.1 (Non-reasoning)Z AI24.21.404.400.260
157DeepSeekDeepSeek V4 Flash 0420 (Reasoning, Max Effort)DeepSeek24.20.0210.3200.016
158OpenAIGPT-5.4 mini (xhigh)OpenAI24.10.7504.500.075
159XiaomiMiMo-V2-OmniXiaomi23.9———
160GoogleGemini 3.5 Flash (minimal)Google23.81.509.000.150
161OpenAIGPT-5.1 Codex (high)OpenAI23.71.2510.00.125
162AnthropicClaude Opus 4.5 (Non-reasoning)Anthropic23.75.0025.00.500
163KimiKimi K2.6 (Non-reasoning)Kimi23.60.6503.410.150
164Z AIGLM 5V Turbo (Reasoning)Z AI23.51.204.000.240
165KimiKimi K2.5 (Reasoning)Kimi23.50.4502.250.070
166AnthropicClaude Sonnet 4.6 (Non-reasoning, Low Effort)Anthropic23.33.0015.00.300
167OpenAIGPT-5.5 (Non-reasoning)OpenAI23.25.0030.00.500
168AnthropicClaude Sonnet 5 (Non-reasoning, High Effort)Anthropic23.22.0010.00.200
169OpenAIGPT-5 (high)OpenAI231.2510.00.125
170AlibabaQwen3.5 27B (Reasoning)Alibaba22.90.1951.56—
171NVIDIANemotron 3 Ultra 550B A55B (Reasoning)NVIDIA22.90.6002.400.120
172OpenAIGPT-5 (medium)OpenAI22.91.2510.00.125
173MiniMaxMiniMax-M2.5MiniMax22.80.2701.080.027
174MiniMaxMiniMax-M2.7MiniMax22.80.3001.200.060
175AnthropicClaude 4.1 Opus (Reasoning)Anthropic22.815.075.01.50
176SA.X-K2SK Telecom22.7———
177TencentHy3-preview (Reasoning)Tencent22.70.1320.5280.033
178OpenAIGPT-5.5 Instant (May 2026)OpenAI22.75.0030.00.500
179ILing-3.0-flash-FinInclusionAI22.60.0600.1800.012
180SpaceXAIGrok 4SpaceXAI22.5———
181XiaomiMiMo-V2-Flash (Feb 2026)Xiaomi22.4———
182Z AIGLM-5.2 (Non-reasoning)Z AI22.40.6502.040.121
183GoogleGemini 3 Pro Preview (low)Google22.3———
184GoogleGemini 3.5 Flash-LiteGoogle22.20.3002.500.030
185Z AIGLM-4.7 (Reasoning)Z AI22.20.6002.200.110
186KimiKimi K2 ThinkingKimi220.6002.500.150
187OpenAIo3-proOpenAI21.920.080.0—
188AG9v3-39A5BAI9Stars21.8———
189Z AIGLM-5 (Non-reasoning)Z AI21.80.6001.920.120
190KKAT Coder Pro V2KwaiKAT21.7———
191DeepSeekDeepSeek V3.2 (Reasoning)DeepSeek21.50.2800.4200.028
192AlibabaQwen3.5 397B A17B (Non-reasoning)Alibaba21.40.5503.500.225
193AlibabaQwen3.6 27B (Reasoning)Alibaba21.40.3203.20—
194AlibabaQwen3 Max ThinkingAlibaba21.30.7803.90—
195OpenAIGPT-5.6 Luna (low)OpenAI210.2001.200.020
196MiniMaxMiniMax-M2.1MiniMax20.90.3001.200.030
197OpenAIGPT-6 Luna (low)OpenAI20.90.1000.5000.010
198DeepSeekDeepSeek V4 Pro 0424 (Non-reasoning)DeepSeek20.80.2524.200.252
199OpenAIGPT-5 (low)OpenAI20.81.2510.00.125
200OpenAIGPT-5.6 Terra (Non-reasoning)OpenAI20.82.0012.00.200
201XiaomiMiMo-V2-Flash (Reasoning)Xiaomi20.8———
202AnthropicClaude 4.5 Sonnet (Reasoning)Anthropic20.73.0015.00.300
203OpenAIGPT-5.4 nano (xhigh)OpenAI20.70.2001.250.020
204IK2 Horizon 7BInstitute of Foundation Models20.6———
205AnthropicClaude 4 Opus (Reasoning)Anthropic20.6———
206OpenAIGPT-5 mini (medium)OpenAI20.60.2502.000.025
207AlibabaQwen3.5 Omni PlusAlibaba20.4———
208SpaceXAIGrok 4.1 Fast (Reasoning)SpaceXAI20.4———
209OpenAIGPT-5.1 Codex mini (high)OpenAI20.40.2502.000.030
210OpenAIo3OpenAI20.22.008.000.500
211AlibabaQwen3.8 27B (Non-reasoning)Alibaba20.20.4203.000.085
212OpenAIGPT-5.4 nano (medium)OpenAI200.2001.250.020
213AlibabaQwen3.6 27B (Non-reasoning)Alibaba19.80.3203.20—
214LK-EXAONE 2.0 0803LG AI Research19.7———
215OpenAIGPT-5.4 mini (medium)OpenAI19.70.7504.500.075
216StepFunStep 3.7 FlashStepFun19.50.2001.150.040
217AlibabaQwen3.5 27B (Non-reasoning)Alibaba19.40.1951.56—
218KimiKimi K2.5 (Non-reasoning)Kimi19.40.4502.250.070
219AlibabaQwen3.5 35B A3B (Reasoning)Alibaba19.30.1631.30—
220AnthropicClaude 4.5 Sonnet (Non-reasoning)Anthropic19.33.0015.00.300
221LLongCat 2.0LongCat19.10.3001.200.0060
222GoogleGemma 4 31B (Reasoning)Google190.0900.3400.050
223AnthropicClaude 4 Sonnet (Reasoning)Anthropic18.93.0015.00.300
224DeepSeekDeepSeek V4 Flash 0420 (Non-reasoning)DeepSeek18.90.0210.3200.016
225CJT-35B-FlashChina Mobile18.7———
226AnthropicClaude 4.1 Opus (Non-reasoning)Anthropic18.615.075.01.50
227MiniMaxMiniMax-M2MiniMax18.60.3001.20—
228KKAT-Coder-Pro V1KwaiKAT18.6———
229Z AIGLM-4.6 (Reasoning)Z AI18.50.4301.750.080
230AlibabaQwen3.5 397B A17B (Reasoning)Alibaba18.40.5503.500.225
231XiaomiMiMo-V2.5-Pro (Non-reasoning)Xiaomi18.30.4350.8700.0036
232OpenAIGPT-6 Luna (Non-reasoning)OpenAI18.30.1000.5000.010
233OpenAIGPT-5.4 (Non-reasoning)OpenAI18.22.5015.00.250
234AlibabaQwen3.6 35B A3B (Reasoning)Alibaba18.20.1501.000.050
235SpaceXAIGrok 4 Fast (Reasoning)SpaceXAI17.9———
236GoogleGemini 3 Flash Preview (Non-reasoning)Google17.90.5003.000.050
237AlibabaQwen3.5 122B A10B (Non-reasoning)Alibaba17.70.2602.08—
238AnthropicClaude 3.7 Sonnet (Reasoning)Anthropic17.7———
239MetaMuse Glimmer (high)Meta17.5———
240Z AIGLM-4.7 (Non-reasoning)Z AI17.40.6002.200.110
241StepFunStep 3.5 Flash 2603StepFun170.1000.300—
242ILing-2.6-1TInclusionAI17———
243OpenAIGPT-5.2 (Non-reasoning)OpenAI171.7514.00.175
244TencentHy3-preview (Non-reasoning)Tencent170.1320.5280.033
245BDoubao Seed CodeByteDance Seed16.9———
246AnthropicClaude 4.5 Haiku (Reasoning)Anthropic16.91.005.000.100
247OpenAIGPT-5 mini (high)OpenAI16.80.2502.000.025
248GoogleGemma 4 26B A4B (Reasoning)Google16.70.0680.2250.037
249OpenAIo4-mini (high)OpenAI16.71.104.400.275
250AnthropicClaude 4 Opus (Non-reasoning)Anthropic16.6———
251DeepSeekDeepSeek V3.2 Exp (Reasoning)DeepSeek16.60.2800.4200.028
252StepFunStep 3.5 FlashStepFun16.60.1000.300—
253AnthropicClaude 4 Sonnet (Non-reasoning)Anthropic16.63.0015.00.300
254IRing-2.6-1TInclusionAI16.6———
255AlibabaQwen3 Max Thinking (Preview)Alibaba16.30.7803.90—
256GoogleGemini 2.5 ProGoogle16.11.2510.00.125
257DeepSeekDeepSeek V3.2 (Non-reasoning)DeepSeek160.2800.4200.028
258XiaomiMiMo-V2-Flash (Non-reasoning)Xiaomi16———
259AlibabaQwen3.5 122B A10B (Reasoning)Alibaba15.60.2602.08—
260IK2 Horizon 3.7BInstitute of Foundation Models15.6———
261GoogleGemini 3.1 Flash-LiteGoogle15.60.2501.500.025
262AlibabaQwen3 MaxAlibaba15.60.7803.90—
263GoogleGemini 2.5 Flash Preview (Sep '25) (Reasoning)Google15.50.3002.500.030
264OpenAIGPT-5.6 Luna (Non-reasoning)OpenAI15.50.2001.200.020
265AnthropicClaude 4.5 Haiku (Non-reasoning)Anthropic15.41.005.000.100
266KimiKimi K2 0905Kimi15.30.6002.500.150
267ILing 3.0 TinyInclusionAI15.3———
268AnthropicClaude 3.7 Sonnet (Non-reasoning)Anthropic15.3———
269OpenAIo1OpenAI15.215.060.07.50
270AlibabaQwen3.6 35B A3B (Non-reasoning)Alibaba15.20.1501.000.050
271AlibabaQwen3.5 35B A3B (Non-reasoning)Alibaba15.10.1631.30—
272GoogleGemini 2.5 Pro Preview (Mar' 25)Google151.2510.00.125
273Z AIGLM-4.7-Flash (Reasoning)Z AI14.90.0600.400—
274Z AIGLM-4.6 (Non-reasoning)Z AI14.90.4301.750.080
275DeepSeekDeepSeek V3.1 Terminus (Reasoning)DeepSeek14.80.2701.000.135
276IBMGranite 4.2 30BIBM14.8———
277SpaceXAIGrok 4.20 0309 (Non-reasoning)SpaceXAI14.61.252.500.200
278SpaceXAIGrok 3 mini Reasoning (high)SpaceXAI14.6———
279GoogleGemini 2.5 Pro Preview (May' 25)Google14.51.2510.00.125
280DeepSeekDeepSeek V3.2 SpecialeDeepSeek14.5———
281LK-EXAONE (Reasoning)LG AI Research14.4———
282BaiduERNIE 5.0 Thinking PreviewBaidu14.3———
283AmazonNova 2.0 Pro Preview (medium)Amazon14.2———
284SpaceXAIGrok 4.20 0309 v2 (Non-reasoning)SpaceXAI14.2———
285MistralMistral Medium 3.5Mistral14.21.507.50—
286GoogleGemma 4 12B (Reasoning)Google14.2———
287SpaceXAIGrok Code Fast 1SpaceXAI14.1———
288SpaceXAIGrok 4.3 (Non-reasoning)SpaceXAI141.252.500.200
289DeepSeekDeepSeek V3.2 Exp (Non-reasoning)DeepSeek13.90.2800.4200.028
290GoogleGemma 4 31B (Non-reasoning)Google13.90.0900.3400.050
291DeepSeekDeepSeek V3.1 Terminus (Non-reasoning)DeepSeek13.90.2701.000.135
292IMercury 2Inception13.80.2500.7500.025
293SApriel-v1.5-15B-ThinkerServiceNow13.8———
294AlibabaQwen3.5 9B (Reasoning)Alibaba13.70.1000.150—
295DeepSeekDeepSeek V3.1 (Non-reasoning)DeepSeek13.7———
296AmazonNova 2.0 Omni (medium)Amazon13.6———
297DeepSeekDeepSeek V3.1 (Reasoning)DeepSeek13.5———
298AmazonNova 2.0 Lite (high)Amazon13.4———
299SApriel-v1.6-15B-ThinkerServiceNow13.4———
300AlibabaQwen3 VL 235B A22B (Reasoning)Alibaba13.40.4004.00—
301AlibabaQwen3.5 9B (Non-reasoning)Alibaba13.30.1000.150—
302OpenAIGPT-5.1 (Non-reasoning)OpenAI13.31.2510.00.125
303LEXAONE 4.5 33BLG AI Research13.2———
304GoogleGemini 2.5 Flash (Reasoning)Google13.10.3002.500.030
305CCommand A+Cohere13.1———
306AlibabaQwen3.5 4B (Reasoning)Alibaba13.1———
307GoogleGemma 4 26B A4B (Non-reasoning)Google13.10.0680.2250.037
308DeepSeekDeepSeek R1 0528 (May '25)DeepSeek13.10.5002.150.350
309OpenAIGPT-5 nano (high)OpenAI130.0500.4000.0050
310NVIDIANemotron 3.5 LightningNVIDIA12.90.0800.2000.040
311Z AIGLM-4.5 (Reasoning)Z AI12.80.6002.200.110
312NVIDIANemotron 3 Super 120B A12B (Reasoning)NVIDIA12.80.0800.450—
313AmazonNova 2.0 Pro Preview (low)Amazon12.8———
314OpenAIGPT-4.1OpenAI12.72.008.000.500
315KimiKimi K2Kimi12.70.6002.500.150
316AlibabaQwen3 235B A22B 2507 (Reasoning)Alibaba12.70.2302.30—
317AlibabaQwen3 Max (Preview)Alibaba12.60.7803.90—
318OpenAIo3-miniOpenAI12.51.104.400.550
319OMiniCPM5-2BOpenBMB12.5———
320AlibabaQwen3.5 Omni FlashAlibaba12.5———
321OpenAIGPT-5 nano (medium)OpenAI12.50.0500.4000.0050
322AmazonNova 2.0 Lite (medium)Amazon12.5———
323GoogleGemini 2.5 Flash Preview (Sep '25) (Non-reasoning)Google12.40.3002.500.030
324OpenAIo1-proOpenAI12.4150600—
325IMercury 2.5Inception12.30.0400.1500.0040
326CJT-MINIChina Mobile12.2———
327SpaceXAIGrok 3SpaceXAI12.1———
328BSeed-OSS-36B-InstructByteDance Seed12.1———
329AlibabaQwen3 235B A22B 2507 InstructAlibaba12———
330AlibabaQwen3 Coder 480B A35B InstructAlibaba11.9———
331AlibabaQwen3 VL 32B (Reasoning)Alibaba11.9———
332PerplexitySonar Reasoning ProPerplexity11.82.008.00—
333AmazonNova 2.0 Lite (low)Amazon11.8———
334MistralMagistral Medium 1.2Mistral11.8———
335MHyperNova 60B 2605 (high, based on gpt-oss-120b)Multiverse Computing11.7———
336GoogleGemini 2.5 Flash Preview (Reasoning)Google11.70.3002.500.030
337NVIDIANemotron Cascade 2 30B A3BNVIDIA11.7———
338MiniMaxMiniMax M1 80kMiniMax11.70.4002.20—
339OpenAIGPT-5.4 nano (Non-Reasoning)OpenAI11.70.2001.250.020
340OpenAIgpt-oss-120b (high)OpenAI11.60.1500.6000.075
341IK2 Think V2Institute of Foundation Models11.5———
342LLongCat Flash LiteLongCat11.5———
343OpenAIo1-previewOpenAI11.415.060.07.50
344DeepSeekDeepSeek R1 (Jan '25)DeepSeek11.40.5002.150.350
345NHyperCLOVA X SEED Think (32B)Naver11.4———
346OpenAIGPT-5 (minimal)OpenAI11.41.2510.00.125
347MistralMistral Small 4 (Reasoning)Mistral11.3———
348SpaceXAIGrok 4.1 Fast (Non-reasoning)SpaceXAI11.3———
349LK-EXAONE (Non-reasoning)LG AI Research11.2———
350AlibabaQwen3 Next 80B A3B (Reasoning)Alibaba11.20.1501.20—
351Z AIGLM-4.6V (Reasoning)Z AI11.20.3000.9000.055
352SpaceXAIGrok 4 Fast (Non-reasoning)SpaceXAI11.1———
353Z AIGLM-4.5-AirZ AI11.10.1300.8500.025
354IBMGranite 4.2 8BIBM11.10.0600.2500.015
355OpenAIGPT-5.4 mini (Non-Reasoning)OpenAI11.10.7504.500.075
356AmazonNova 2.0 Omni (low)Amazon11.1———
357OpenAIo3-mini (high)OpenAI111.104.400.550
358KMi:dm K 2.5 ProKorea Telecom11———
359IRing-1TInclusionAI10.9———
360AG9v3-3BAI9Stars10.8———
361AlibabaQwen3.5 4B (Non-reasoning)Alibaba10.8———
362ATrinity Large ThinkingArcee AI10.80.2500.8000.060
363PINTELLECT-3 (based on GLM-4.5-Air)Prime Intellect10.6———
364Z AIGLM-4.7-Flash (Non-reasoning)Z AI10.60.0600.400—
365USolar Open 100B (Reasoning)Upstage10.4———
366GoogleGemini 2.5 Flash-Lite Preview (Sep '25) (Reasoning)Google10.40.1000.4000.010
367OpenAIGPT-5 (ChatGPT)OpenAI10.41.2510.00.125
368SpaceXAIGrok 3 Reasoning BetaSpaceXAI10.4———
369NVIDIANemotron 3 Nano Omni 30B A3B ReasoningNVIDIA10.3———
370OpenAIGPT-4.1 miniOpenAI10.20.4001.600.100
371OpenAIgpt-oss-120b (low)OpenAI10.20.1500.6000.075
372OpenAIgpt-oss-20b (low)OpenAI100.0180.090—
373MiniMaxMiniMax M1 40kMiniMax100.4002.20—
374MetaLlama 4 MaverickMeta100.1880.652—
375AmazonNova 2.0 Pro Preview (Non-reasoning)Amazon10———
376CNorth Mini CodeCohere9.9———
377GoogleGemini 2.5 Flash (Non-reasoning)Google9.90.3002.500.030
378IK2-V2 (high)Institute of Foundation Models9.9———
379OpenAIGPT-5 mini (minimal)OpenAI9.90.2502.000.025
380AlibabaQwen3 VL 235B A22B InstructAlibaba9.90.2101.900.100
381AlibabaQwen3 30B A3B 2507 (Reasoning)Alibaba9.80.2002.40—
382OpenAIo1-miniOpenAI9.8———
383DeepSeekDeepSeek V3 0324DeepSeek9.7———
384ILing 2.6 FlashInclusionAI9.7———
385AlibabaQwen3 Next 80B A3B InstructAlibaba9.60.1001.100.070
386OpenAIGPT-4.5 (Preview)OpenAI9.62.5015.00.250
387TTri-21B-think PreviewTrillion Labs9.6———
388AlibabaQwen3 Coder 30B A3B InstructAlibaba9.60.0700.280—
389AlibabaQwen3 235B A22B (Reasoning)Alibaba9.50.2302.30—
390GoogleDiffusionGemma 26B A4BGoogle9.5———
391AlibabaQwen3 VL 30B A3B (Reasoning)Alibaba9.50.2002.40—
392AlibabaQwQ 32BAlibaba9.5———
393GoogleGemma 4 12B (Non-reasoning)Google9.4———
394GoogleGemini 2.0 Flash Thinking Experimental (Jan '25)Google9.4———
395MistralMistral Large 3Mistral9.3———
396GoogleGemini 2.5 Flash-Lite Preview (Sep '25) (Non-reasoning)Google9.30.1000.4000.010
397MistralMistral Medium 3.1Mistral9.20.4002.000.040
398ILing-1TInclusionAI9.2———
399MMotif-2-12.7B-ReasoningMotif Technologies9.2———
400AmazonNova PremierAmazon9.2———
401AlibabaQwen3 Coder NextAlibaba9.20.1200.8000.070
402IBMGranite 4.2 3BIBM9.1———
403MistralMagistral Medium 1Mistral9.1———
404USolar Pro 2 (Preview) (Reasoning)Upstage9.1———
405MistralMistral Small 4 (Non-reasoning)Mistral9———
406OpenAIgpt-oss-20b (high)OpenAI90.0180.090—
407OpenAIGPT-4o (March 2025, chatgpt-4o-latest)OpenAI92.5010.01.25
408MistralMistral Medium 3Mistral90.4002.000.040
409TTri-21B-ThinkTrillion Labs9———
410MistralDevstral MediumMistral90.4002.000.040
411IK2-V2 (medium)Institute of Foundation Models9———
412NVIDIALlama Nemotron Super 49B v1.5 (Reasoning)NVIDIA9———
413AnthropicClaude 3.5 HaikuAnthropic8.9———
414NVIDIALlama 3.3 Nemotron Super 49B v1 (Reasoning)NVIDIA8.9———
415NVIDIANVIDIA Nemotron 3 Nano 30B A3B (Reasoning)NVIDIA8.9———
416GoogleGemini 2.0 Flash (Feb '25)Google8.9———
417GoogleGemma 4 E4B (Reasoning)Google8.9———
418AlibabaQwen3 4B 2507 (Reasoning)Alibaba8.8———
419SSarvam 105B (high)Sarvam8.8———
420OMiniCPM5-1B (Reasoning)OpenBMB8.8———
421PerplexitySonar ReasoningPerplexity8.7———
422GoogleGemini 2.5 Flash Preview (Non-reasoning)Google8.70.3002.500.030
423AmazonNova 2.0 Lite (Non-reasoning)Amazon8.7———
424AnthropicClaude 3 OpusAnthropic8.7———
425GoogleGemini 2.0 Pro Experimental (Feb '25)Google8.7———
426MistralDevstral Small (May '25)Mistral8.7———
427OMiniCPM5-1B (Non-reasoning)OpenBMB8.7———
428MistralDevstral 2Mistral8.6———
429MistralMagistral Small 1.2Mistral8.6———
430AlibabaQwen3 32B (Reasoning)Alibaba8.60.0800.280—
431DeepSeekDeepSeek V3 (Dec '24)DeepSeek8.5———
432GoogleGemini 2.5 Flash-Lite (Reasoning)Google8.50.1000.4000.010
433Z AIGLM-4.6V (Non-reasoning)Z AI8.40.3000.9000.055
434AlibabaQwen3 VL 32B InstructAlibaba8.40.1040.416—
435NNanbeige4.1-3BNanbeige8.4———
436OpenAIGPT-4o (Nov '24)OpenAI8.42.5010.01.25
437DeepSeekDeepSeek R1 Distill Qwen 32BDeepSeek8.4———
438LLFM2.5-2.6BLiquid AI8.4———
439AlibabaQwen3 235B A22B (Non-reasoning)Alibaba8.30.2302.30—
440MistralMagistral Small 1Mistral8.2———
441AmazonNova 2.0 Omni (Non-reasoning)Amazon8.2———
442MistralMistral Small 3.2Mistral8.2———
443LEXAONE 4.0 32B (Reasoning)LG AI Research8.2———
444AlibabaQwen3 14B (Reasoning)Alibaba8.20.1200.240—
445AlibabaQwen3 VL 8B (Reasoning)Alibaba8.20.1802.10—
446GoogleGemini 2.0 Flash (experimental)Google8.2———
447DeepSeekDeepSeek R1 0528 Qwen3 8BDeepSeek8.1———
448MetaLlama 4 ScoutMeta8.10.1000.300—
449AlibabaQwen2.5 MaxAlibaba8———
450AnthropicClaude 3.5 Sonnet (Oct '24)Anthropic7.9———
451GoogleGemini 1.5 Pro (Sep '24)Google7.9———
452USolar Pro 2 (Preview) (Non-reasoning)Upstage7.9———
453DeepSeekDeepSeek R1 Distill Llama 70BDeepSeek7.90.8000.800—
454AlibabaQwen3 VL 30B A3B InstructAlibaba7.90.1500.600—
455NHermes 4 - Llama-3.1 70B (Reasoning)Nous Research7.9———
456OpenAIGPT-4.1 nanoOpenAI7.80.1000.4000.025
457ILing-flash-2.0InclusionAI7.8———
458GoogleGemma 4 E2B (Reasoning)Google7.8———
459DeepSeekDeepSeek R1 Distill Qwen 14BDeepSeek7.8———
460USolar Pro 3Upstage7.80.1500.6000.015
461AlibabaQwen3 Omni 30B A3B (Reasoning)Alibaba7.8———
462TFalcon-H1R-7BTII UAE7.8———
463PerplexitySonarPerplexity7.71.001.00—
464OpenAIGPT-4o (Aug '24)OpenAI7.72.5010.01.25
465MetaLlama 3.3 Instruct 70BMeta7.70.1000.320—
466StepFunStep3 VL 10BStepFun7.7———
467AlibabaQwen2.5 Instruct 72BAlibaba7.7———
468Z AIGLM-4.5V (Reasoning)Z AI7.60.6001.800.110
469PerplexitySonar ProPerplexity7.63.0015.0—
470AlibabaQwen3 30B A3B (Reasoning)Alibaba7.60.2002.40—
471MistralMistral Large 2 (Nov '24)Mistral7.6———
472AlibabaQwQ 32B-PreviewAlibaba7.6———
473MistralDevstral Small (Jul '25)Mistral7.6———
474GoogleGemma 4 E4B (Non-reasoning)Google7.5———
475NVIDIANVIDIA Nemotron Nano 12B v2 VL (Reasoning)NVIDIA7.5———
476AlibabaQwen3 30B A3B 2507 InstructAlibaba7.50.1000.300—
477NHermes 4 - Llama-3.1 405B (Reasoning)Nous Research7.5———
478BaiduERNIE 4.5 300B A47BBaidu7.5———
479MistralDevstral Small 2Mistral7.5———
480NVIDIALlama 3.1 Nemotron Ultra 253B v1 (Reasoning)NVIDIA7.5———
481USolar Pro 2 (Reasoning)Upstage7.5———
482NVIDIALlama Nemotron Super 49B v1.5 (Non-reasoning)NVIDIA7.4———
483GoogleGemini 2.0 Flash-Lite (Feb '25)Google7.4———
484NVIDIANVIDIA Nemotron 3 Nano 4BNVIDIA7.4———
485NHermes 4 - Llama-3.1 405B (Non-reasoning)Nous Research7.4———
486IBMGranite 4.1 30BIBM7.4———
487NVIDIANVIDIA Nemotron Nano 9B V2 (Reasoning)NVIDIA7.4———
488AlibabaQwen3 VL 8B InstructAlibaba7.30.1170.455—
489GoogleGemini 2.0 Flash-Lite (Preview)Google7.3———
490MetaLlama 3.1 Instruct 405BMeta7.3———
491KimiKimi Linear 48B A3B InstructKimi7.3———
492AlibabaQwen3 8B (Reasoning)Alibaba7.30.1170.455—
493NVIDIALlama 3.1 Nemotron Nano 4B v1.1 (Reasoning)NVIDIA7.3———
494AlibabaQwen3 32B (Non-reasoning)Alibaba7.30.0800.280—
495NVIDIALlama 3.3 Nemotron Super 49B v1 (Non-reasoning)NVIDIA7.3———
496IK2-V2 (low)Institute of Foundation Models7.3———
497OpenAIGPT-4o (May '24)OpenAI7.32.5010.01.25
498AlibabaQwen3 4B (Reasoning)Alibaba7.2———
499IRing-flash-2.0InclusionAI7.2———
500AnthropicClaude 3.5 Sonnet (June '24)Anthropic7.2———
501OpenAIGPT-4o (ChatGPT)OpenAI7.22.5010.01.25
502LLFM2.5-8B-A1BLiquid AI7.2———
503ALlama 3.1 Tulu3 405BAllen Institute for AI7.2———
504OpenAIGPT-5 nano (minimal)OpenAI7.10.0500.4000.0050
505MistralMistral Small 3.1Mistral7.1———
506SpaceXAIGrok 2 (Dec '24)SpaceXAI7.1———
507AOlmo 3.1 32B ThinkAllen Institute for AI7.1———
508GoogleGemini 1.5 Flash (Sep '24)Google7.1———
509MistralPixtral LargeMistral7.1———
510CCommand ACohere72.5010.0—
511USolar Pro 2 (Non-reasoning)Upstage7———
512AmazonNova ProAmazon7———
513OpenAIGPT-4 TurboOpenAI710.030.0—
514AlibabaQwen3 VL 4B (Reasoning)Alibaba7———
515AlibabaQwen2.5 Instruct 32BAlibaba6.9———
516AlibabaQwen3.5 2B (Reasoning)Alibaba6.9———
517NVIDIALlama 3.1 Nemotron Instruct 70BNVIDIA6.9———
518MetaLlama 3.1 Instruct 8BMeta6.90.0500.0800.025
519SpaceXAIGrok BetaSpaceXAI6.91.604.800.400
520MistralMistral Large 2 (Jul '24)Mistral6.8———
521NVIDIANVIDIA Nemotron 3 Nano 30B A3B (Non-reasoning)NVIDIA6.8———
522NVIDIANVIDIA Nemotron Nano 9B V2 (Non-reasoning)NVIDIA6.8———
523Z AIGLM-4.5V (Non-reasoning)Z AI6.70.6001.800.110
524AlibabaQwen2.5 Coder Instruct 32BAlibaba6.7———
525GoogleGemini 2.5 Flash-Lite (Non-reasoning)Google6.70.1000.4000.010
526NHermes 4 - Llama-3.1 70B (Non-reasoning)Nous Research6.7———
527AmazonNova LiteAmazon6.7———
528OpenAIGPT-4OpenAI6.730.060.0—
529AlibabaQwen3 4B 2507 InstructAlibaba6.7———
530OpenAIGPT-4o miniOpenAI6.70.1500.6000.075
531MistralMistral Small 3Mistral6.7———
532AlibabaQwen3 14B (Non-reasoning)Alibaba6.70.1200.240—
533MetaLlama 3.1 Instruct 70BMeta6.60.4000.400—
534SSarvam 30B (high)Sarvam6.6———
535IBMGranite 4.1 8BIBM6.6———
536DeepSeekDeepSeek-V2.5DeepSeek6.6———
537DeepSeekDeepSeek-V2.5 (Dec '24)DeepSeek6.6———
538GoogleGemini 2.0 Flash Thinking Experimental (Dec '24)Google6.6———
539AlibabaQwen3 4B (Non-reasoning)Alibaba6.6———
540AlibabaQwen3 30B A3B (Non-reasoning)Alibaba6.60.2002.40—
541DeepSeekDeepSeek R1 Distill Llama 8BDeepSeek6.5———
542GoogleGemma 4 E2B (Non-reasoning)Google6.5———
543MistralMistral SabaMistral6.50.2000.6000.020
544AOlmo 3.1 32B InstructAllen Institute for AI6.5———
545AOlmo 3 32B ThinkAllen Institute for AI6.5———
546GoogleGemini 1.5 Pro (May '24)Google6.4———
547AlibabaQwen2.5 TurboAlibaba6.4———
548PerplexityR1 1776Perplexity6.4———
549MetaLlama 3.2 Instruct 90B (Vision)Meta6.4———
550RReka Flash (Sep '24)Reka AI6.4———
551USolar MiniUpstage6.4———
552LEXAONE 4.0 32B (Non-reasoning)LG AI Research6.3———
553SpaceXAIGrok-1SpaceXAI6.3———
554AlibabaQwen2 Instruct 72BAlibaba6.3———
555CCeleris-1Celeris6.3———
556MicrosoftPhi-4 Mini InstructMicrosoft6.3———
557AlibabaQwen3.5 2B (Non-reasoning)Alibaba6.2———
558GoogleGemini 1.5 Flash-8BGoogle6.2———
559AJamba 1.7 LargeAI21 Labs6.1———
560AlibabaQwen3.5 0.8B (Reasoning)Alibaba6.1———
561NDeepHermes 3 - Mistral 24B Preview (Non-reasoning)Nous Research6.1———
562AlibabaQwen3 Omni 30B A3B InstructAlibaba6———
563NHermes 3 - Llama-3.1 70BNous Research60.7000.700—
564AOLMo 2 32BAllen Institute for AI6———
565IBMGranite 4.0 H SmallIBM6———
566MistralMinistral 3 14BMistral6———
567DeepSeekDeepSeek-Coder-V2DeepSeek6———
568AJamba 1.6 LargeAI21 Labs6———
569AlibabaQwen3 8B (Non-reasoning)Alibaba60.1170.455—
570AJamba 1.5 LargeAI21 Labs6———
571AmazonNova MicroAmazon5.9———
572IBMGranite 4.1 3BIBM5.9———
573GoogleGemini 1.5 Flash (May '24)Google5.9———
574AnthropicClaude 3 SonnetAnthropic5.9———
575MicrosoftPhi-4Microsoft5.90.0700.140—
576LLFM2 24B A2BLiquid AI5.9———
577GoogleGemini 1.0 UltraGoogle5.8———
578MicrosoftPhi-4 Multimodal InstructMicrosoft5.8———
579MistralMistral Large (Feb '24)Mistral5.80.5001.500.050
580MistralMistral Small (Sep '24)Mistral5.80.1500.6000.015
581NVIDIANVIDIA Nemotron Nano 12B v2 VL (Non-reasoning)NVIDIA5.8———
582GoogleGemma 3n E4B Instruct Preview (May '25)Google5.8———
583MicrosoftPhi-3 Mini Instruct 3.8BMicrosoft5.8———
584AlibabaQwen2.5 Coder Instruct 7BAlibaba5.8———
585OMiniCPM-V 4.6 1.3BOpenBMB5.7———
586MetaLlama 3.2 Instruct 3BMeta5.70.0500.330—
587MistralMixtral 8x22B InstructMistral5.72.006.000.200
588AlibabaQwen1.5 Chat 110BAlibaba5.7———
589AlibabaQwen3 VL 4B InstructAlibaba5.7———
590AJamba Reasoning 3BAI21 Labs5.7———
591MetaLlama 2 Chat 7BMeta5.7———
592AnthropicClaude 3 HaikuAnthropic5.6———
593AOlmo 3 7B ThinkAllen Institute for AI5.6———
594AnthropicClaude 2.1Anthropic5.6———
595AMolmo 7B-DAllen Institute for AI5.6———
596RReka Flash 3Reka AI5.60.1000.200—
597AOLMo 2 7BAllen Institute for AI5.6———
598OpenAIGPT-3.5 TurboOpenAI5.51.002.00—
599MistralMistral MediumMistral5.5———
600DeepSeekDeepSeek-V2-ChatDeepSeek5.5———
601MistralMistral Small (Feb '24)Mistral5.50.1500.6000.015
602ILing-mini-2.0InclusionAI5.5———
603DeepSeekDeepSeek R1 Distill Qwen 1.5BDeepSeek5.5———
604MistralMinistral 3 8BMistral5.5———
605MetaLlama 3 Instruct 70BMeta5.5———
606AnthropicClaude 2.0Anthropic5.5———
607LLFM 40BLiquid AI5.4———
608AlibabaQwen3.5 0.8B (Non-reasoning)Alibaba5.4———
609AlibabaQwen Chat 72BAlibaba5.4———
610GooglePALM-2Google5.4———
611MetaLlama 3.2 Instruct 11B (Vision)Meta5.4———
612SArctic InstructSnowflake5.4———
613DDBRX InstructDatabricks5.3———
614SSarvam M (Reasoning, based on Mistral Small 3.1)Sarvam5.3———
615MetaLlama 2 Chat 70BMeta5.3———
616MetaLlama 2 Chat 13BMeta5.3———
617CCommand-R+ (Apr '24)Cohere5.3———
618DeepSeekDeepSeek LLM 67B Chat (V1)DeepSeek5.3———
619GoogleGemini 1.0 ProGoogle5.3———
620DeepSeekDeepSeek Coder V2 Lite InstructDeepSeek5.3———
621LExaone 4.0 1.2B (Reasoning)LG AI Research5.3———
622OOpenChat 3.5 (1210)OpenChat5.3———
623LLFM2.5-1.2B-InstructLiquid AI5.2———
624AJamba 1.5 MiniAI21 Labs5.2———
625AlibabaQwen3 1.7B (Reasoning)Alibaba5.2———
626LLFM2.5-1.2B-ThinkingLiquid AI5.2———
627LLFM2 2.6BLiquid AI5.2———
628LExaone 4.0 1.2B (Non-reasoning)LG AI Research5.2———
629AOlmo 3 7B InstructAllen Institute for AI5.2———
630AJamba 1.7 MiniAI21 Labs5.2———
631IBMGranite 4.0 H 1BIBM5.2———
632AJamba 1.6 MiniAI21 Labs5.2———
633GoogleGemma 3 270MGoogle5.1———
634IBMGranite 4.0 MicroIBM5.1———
635MistralMixtral 8x7B InstructMistral5.1———
636SApertus 70B InstructSwiss AI Initiative5.1———
637NDeepHermes 3 - Llama-3.1 8B Preview (Non-reasoning)Nous Research5.1———
638MistralMistral 7B InstructMistral5———
639AMolmo2-8BAllen Institute for AI5———
640AnthropicClaude InstantAnthropic5———
641IBMGranite 4.0 1BIBM5———
642CCommand-R (Mar '24)Cohere5———
643AlibabaQwen Chat 14BAlibaba5———
644MetaLlama 65BMeta5———
645AlibabaQwen3 1.7B (Non-reasoning)Alibaba4.9———
646GoogleGemma 3 27B InstructGoogle4.9———
647IBMGranite 3.3 8B (Non-reasoning)IBM4.9———
648LLFM2 8B A1BLiquid AI4.9———
649AlibabaQwen3 0.6B (Non-reasoning)Alibaba4.8———
650LLFM2 1.2BLiquid AI4.8———
651GoogleGemma 3 4B InstructGoogle4.8———
652LLFM2.5-VL-1.6BLiquid AI4.8———
653AlibabaQwen3 0.6B (Reasoning)Alibaba4.8———
654IBMGranite 4.0 350MIBM4.8———
655MistralMinistral 3 3BMistral4.8———
656MetaLlama 3.2 Instruct 1BMeta4.80.0270.201—
657CTiny Aya GlobalCohere4.8———
658MetaLlama 3 Instruct 8BMeta4.8———
659SApertus 8B InstructSwiss AI Initiative4.8———
660IBMGranite 4.0 H 350MIBM4.8———
661GoogleGemma 3n E4B InstructGoogle4.8———
662GoogleGemma 3n E2B InstructGoogle4.8———
663GoogleGemma 3 1B InstructGoogle4.8———
664GoogleGemma 3 12B InstructGoogle3.8———
665IK2 Horizon 0.9BInstitute of Foundation Models3———

Source: Artificial Analysis · Updated Sep 28, 2026 · PandaNpc Updated Sep 28, 2026, 06:00 UTCView full leaderboard →

How to read these numbers

An LLM leaderboard tells you which model people prefer; an AI benchmark tells you what a model can objectively do; usage data tells you what developers actually ship. No single ranking answers "which is the best AI model", so this page aggregates all three — Chatbot Arena Elo from arena.ai, the Artificial Analysis Intelligence Index and speech arenas, and OpenRouter token share — and refreshes them daily.

arena.ai (formerly LMArena) shows users two anonymous answers to the same prompt and asks them to pick one, then derives an Elo rating from those battles. It measures which answer people prefer — not objective capability. A likeable style can win, while a rigorous but verbose answer can lose.

Votes are the battles a model has accumulated. A newly listed model has few votes and a wide confidence interval, so its rank swings easily — always read the rank together with the ± interval.

The Agent board works differently from the rest: it measures real agent sessions rather than blind-vote preference. Its headline metric, Net Improvement, is a percentage gain — not an Elo rating — so it cannot be compared across boards. arena.ai also reports five more dimensions (Confirmed Success, Steerability, Bash Recovery and others) on the full leaderboard.

The usage board comes from OpenRouter and counts real API token share — developers voting with their wallets, which complements the subjective preference boards.

The speech boards come from Artificial Analysis: TTS uses blind-listening Speech Arena Elo; ASR uses AA-WER v2, where lower is better; and native Speech-to-Speech uses an equal-weight composite of Big Bench Audio, Full Duplex Bench and τ-Voice, where higher is better. Compare scores only within the same board. Source: artificialanalysis.ai.

The Intelligence Index board comes from Artificial Analysis: it distills many public benchmarks into a single 0-100 Intelligence Index, measuring objective capability rather than subjective preference — a natural complement to arena.ai's human blind vote. Source: artificialanalysis.ai.