Math

AIME 2024/2025 Leaderboard

AIME (American Invitational Mathematics Examination) is a prestigious high-school competition of hard, integer-answer problems. It's a widely-cited yardstick for multi-step mathematical reasoning, here on the 2024–2025 papers.

Source: epoch74 open models ranked+196 proprietaryData through Sep 2026

All models ranked on AIME 2024/2025

Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.

#ModelScore
1Claude Fable 5 (high) · proprietary
100.0%
2Claude Fable 5.1 Max · proprietary
100.0%
3GPT 5.5 Pre Release (xhigh) · proprietary
100.0%
4GPT 5.5 Pro Pre Release (xhigh) · proprietary
100.0%
5GPT 5.6 Sol Max · proprietary
100.0%
6GPT 6 Astra Max · proprietary
100.0%
7Claude Fable 5 Max · proprietary
99.7%
8GPT 5.6 Terra Max · proprietary
99.7%
9Qwen3.8 Max (xhigh) · proprietary
99.4%
10Grok 4.6 (xhigh) · proprietary
99.2%
11Claude Opus 5 Max · proprietary
98.9%
12DeepSeek V4 Pro 0813 · 1650.5B
98.6%
13Claude Opus 4.8 Max · proprietary
98.3%
14GPT 5.6 Luna Max · proprietary
98.3%
15Claude Opus 4.7 (xhigh) · proprietary
97.8%
16Claude Fable 5 (low) · proprietary
97.8%
17Claude Opus 4.8 (low) · proprietary
97.8%
18Claude Opus 5 · proprietary
97.8%
19GPT 5.4 (Mar 05, 2026, high) · proprietary
97.8%
20Grok 4.5 (high) · proprietary
97.8%
21Grok 4.6 (high) · proprietary
97.8%
22Gemini 3.7 Flash (high) · proprietary
97.2%
23Kimi K3 · 2779.9B
97.2%
24DeepSeek V4 Pro · 1598.8B
96.7%
25GPT 5.2 (Dec 11, 2025, high) · proprietary
96.1%
26Kimi K2.6 · 1026.9B
96.1%
27GPT 5.2 (Dec 11, 2025, xhigh) · proprietary
96.1%
28Gemini 3.1 Pro Preview · proprietary
95.6%
29Gemini 3 Flash Preview (high) · proprietary
95.6%
30Gemini 3.1 Pro Preview (high) · proprietary
95.6%
31Gemini 3.5 Flash (high) · proprietary
95.6%
32GPT 5.4 (Mar 05, 2026, medium) · proprietary
95.6%
33GPT 5.6 Sol (low) · proprietary
95.6%
34Kimi K2.7 Code · 1026.9B
95.6%
35Qwen3.7 Max · proprietary
95.6%
36GPT 5.4 (Mar 05, 2026, xhigh) · proprietary
95.3%
37Claude Sonnet 5 (xhigh) · proprietary
94.7%
38Claude Opus 4.6 (64K) · proprietary
94.4%
39DeepSeek V4 Flash 0731 · 304.2B
94.4%
40Gemini 3.6 Flash (high) · proprietary
94.2%
41GLM 5.3 Flash · 321.3B
93.9%
42GPT 5.2 (Dec 11, 2025, medium) · proprietary
93.9%
43Claude Opus 5 (low) · proprietary
93.3%
44GLM 5.1 · 753.9B
93.3%
45Grok 4.3 (high) · proprietary
93.3%
46Qwen3.6 Plus · proprietary
93.3%
47Qwen3.7 Plus · proprietary
93.3%
48Claude Opus 4.6 (32K) · proprietary
93.1%
49Gemini 3 Flash Preview · proprietary
92.8%
50Grok 4.20 0309 Reasoning · proprietary
92.2%
51Kimi K2.5 · 1026.9B
92.2%
52Gemini 3 Pro Preview · proprietary
91.4%
53GPT 5 (Aug 07, 2025, high) · proprietary
91.4%
54Claude Opus 4.6 Max · proprietary
91.1%
55GLM 5.3 · 753.3B
91.1%
56Qwen3.6 27B · 27.8B
91.1%
57Qwen3.6 Max Preview · proprietary
91.1%
58Inkling Small · 266.0B
90.0%
59Muse Spark · proprietary
88.9%
60Gemini 3.5 Flash (low) · proprietary
88.9%
61GPT 5.4 Mini (Mar 17, 2026, xhigh) · proprietary
88.9%
62GPT 5.6 Terra (low) · proprietary
88.9%
63GPT OSS 120B · 116.8B
88.9%
64Inkling · 952.4B
88.9%
65Qwen3.5 397B A17B · 403.4B
88.9%
66GPT 5.1 (Nov 13, 2025, high) · proprietary
88.6%
67DeepSeek Reasoner · proprietary
87.8%
68GPT 5.4 Nano (Mar 17, 2026, high) · proprietary
87.8%
69GPT 5 (Aug 07, 2025, medium) · proprietary
87.2%
70GPT 5.4 Mini (Mar 17, 2026, high) · proprietary
87.2%
71Claude Opus 4.7 Max · proprietary
86.7%
72GPT 5 Mini (Aug 07, 2025, high) · proprietary
86.7%
73Nemotron 3 Ultra · proprietary
86.7%
74Qwen3 235B A22B Thinking 2507 · 235.1B
86.7%
75Qwen3.5 Plus · proprietary
86.7%
76Qwen3.6 35B A3B · 36.0B
86.7%
77Qwen3.7 Flash · proprietary
86.7%
78GLM 5.2 · 753.3B
86.4%
79Claude Opus 4.5 (Nov 01, 2025, 32K) · proprietary
86.1%
80Claude Sonnet 4.6 (32K) · proprietary
85.8%
81GPT 5.1 (Nov 13, 2025, medium) · proprietary
85.6%
82Claude Opus 4.8 None · proprietary
84.4%
83GPT 5.4 (Mar 05, 2026, low) · proprietary
84.4%
84GPT 5.5 (low) · proprietary
84.4%
85O3 (Apr 16, 2025, medium) · proprietary
84.4%
86Qwen3.5 Flash · proprietary
84.4%
87Qwen3.6 Flash · proprietary
84.4%
88Gemini 2.5 Pro · proprietary
84.2%
89Grok 4 (Jul 09) · proprietary
84.0%
90O3 (Apr 16, 2025, high) · proprietary
83.9%
91GLM 4.7 · 358.3B
83.3%
92Kimi K2 Thinking · 1026.4B
83.1%
93Claude Sonnet 4.6 (medium) · proprietary
82.2%
94Gemini 3.6 Flash (low) · proprietary
82.2%
95Gemma 4 26B A4B IT · 25.8B
82.2%
96Claude Opus 4.5 (Nov 01, 2025, 16K) · proprietary
81.7%
97O4 Mini (Apr 16, 2025, high) · proprietary
81.7%
98GPT 5 Nano (Aug 07, 2025, high) · proprietary
81.1%
99Claude Sonnet 5 Max · proprietary
80.0%
100Gemini 3.1 Flash Lite (high) · proprietary
80.0%
101Gemini 3.5 Flash (minimal) · proprietary
80.0%
102Gemini 3.6 Flash (minimal) · proprietary
80.0%
103GLM 5 · 753.9B
80.0%
104Qwen3.7 Plus None · proprietary
80.0%
105GPT 5.2 (Dec 11, 2025, low) · proprietary
78.9%
106GPT 5 Mini (Aug 07, 2025, medium) · proprietary
78.3%
107Claude Sonnet 4.5 (Sep 29, 2025, 32K) · proprietary
77.8%
108Claude Sonnet 4.5 (Sep 29, 2025, 59K) · proprietary
77.8%
109Grok 3 Mini Beta (high) · proprietary
77.8%
110Qwen3.7 Flash None · proprietary
77.8%
111O3 Mini (Jan 31, 2025, high) · proprietary
76.9%
112Claude Sonnet 4.6 (high) · proprietary
75.6%
113GPT 5 Nano (Aug 07, 2025, medium) · proprietary
74.2%
114Gemma 4 31B IT · 31.3B
73.3%
115O1 (Dec 17, 2024, high) · proprietary
73.3%
116O1 (Dec 17, 2024, medium) · proprietary
73.3%
117O4 Mini (Apr 16, 2025, medium) · proprietary
73.3%
118Qwen3 Max (Sep 23, 2025) · proprietary
73.3%
119Gemini 2.5 Flash Preview (Apr 17) · proprietary
73.1%
120Claude Sonnet 4 (May 14, 2025, 32K) · proprietary
71.1%
121Claude Sonnet 4.5 (Sep 29, 2025, 16K) · proprietary
71.1%
122Claude Sonnet 4.6 Max · proprietary
71.1%
123Gemini 3.5 Flash Lite (high) · proprietary
71.1%
124MiniMax M3 · 427.0B
71.1%
125Gemini 2.5 Flash Preview (May 20) · proprietary
70.8%
126Qwen3 30B A3B Thinking 2507 · 30.5B
70.3%
127Qwen3.5 35B A3B None · proprietary
70.0%
128Claude Opus 4.1 (Aug 05, 2025, 27K) · proprietary
68.9%
129Claude Sonnet 4 (May 14, 2025, 59K) · proprietary
68.9%
130GPT 5.4 Nano (Mar 17, 2026, low) · proprietary
68.9%
131GPT 5.6 Sol None · proprietary
68.9%
132GPT 5.5 Instant · proprietary
68.1%
133Seed OSS 36B Instruct · 36.2B
67.5%
134Qwen3 32B · 32.8B
66.9%
135Claude Haiku 4.5 (Oct 01, 2025, 32K) · proprietary
66.7%
136GPT 5.6 Luna (low) · proprietary
66.7%
137DeepSeek R1 0528 · 684.5B
66.4%
138Qwen3 14B · 14.8B
66.4%
139GPT OSS 20B · 20.9B
65.3%
140Claude Opus 4 (May 14, 2025, 27K) · proprietary
64.4%
141Claude Opus 4.1 (Aug 05, 2025, 16K) · proprietary
64.4%
142GPT 5.1 (Nov 13, 2025, low) · proprietary
63.9%
143O3 Mini (Jan 31, 2025, medium) · proprietary
63.9%
144Qwen3 30B A3B · 30.5B
62.8%
145GPT 5.2 2025 12.11 None · proprietary
62.2%
146Grok 3 Mini Beta (low) · proprietary
62.2%
147Qwen3 30B A3B Instruct 2507 · 30.5B
62.2%
148Qwen3.5 9B · 9.7B
61.7%
149Claude Opus 4 (May 14, 2025, 16K) · proprietary
60.0%
150Gemini 3.5 Flash Lite (low) · proprietary
60.0%
151O3 (Apr 16, 2025, low) · proprietary
60.0%
152QwQ 32B · 32.8B
59.2%
153GLM 4.7 Flash · 31.2B
58.3%
154Claude 3.7 Sonnet (Feb 19, 2025, 64K) · proprietary
57.8%
155Gemini 2.0 Flash Thinking Exp (Jan 21) · proprietary
57.8%
156GPT 5.4 2026 03.05 None · proprietary
57.8%
157GPT 5.5 None · proprietary
57.8%
158O4 Mini (Apr 16, 2025, low) · proprietary
57.8%
159Qwen3 8B · 8.2B
56.1%
160Qwen3.5 4B · 4.7B
55.8%
161DeepSeek R1 Distill Qwen 32B · 32.8B
55.6%
162GPT 5 Mini (Aug 07, 2025, minimal) · proprietary
55.6%
163Grok 3 Beta · proprietary
55.6%
164Qwen3.5 35B A3B · proprietary
54.4%
165Claude 3.7 Sonnet (Feb 19, 2025, 32K) · proprietary
53.3%
166Claude Sonnet 4 (May 14, 2025, 16K) · proprietary
53.3%
167DeepSeek R1 · 684.5B
53.3%
168GPT 5.6 Terra None · proprietary
53.3%
169O1 (Dec 17, 2024, low) · proprietary
53.3%
170Qwen3 4B Instruct 2507 · 4.0B
52.2%
171DeepSeek R1 Distill Llama 70B · 70.6B
51.4%
172Gemini 3.5 Flash Lite (minimal) · proprietary
51.1%
173DeepSeek R1 Distill Qwen 14B · 14.8B
50.6%
174DeepSeek Chat · proprietary
48.9%
175Claude Opus 4.5 (Nov 01, 2025) · proprietary
48.1%
176O1 Mini (Sep 12, 2024, high) · proprietary
46.9%
177Claude 3.7 Sonnet (Feb 19, 2025, 16K) · proprietary
46.7%
178GPT 5 (Aug 07, 2025, minimal) · proprietary
46.7%
179GPT 5 Nano (Aug 07, 2025, low) · proprietary
46.7%
180GPT 5.4 Nano 2026 03.17 None · proprietary
46.7%
181GPT 4.1 Mini (Apr 14, 2025) · proprietary
44.7%
182O1 Mini (Sep 12, 2024, medium) · proprietary
44.7%
183Gemini 3.1 Flash Lite (low) · proprietary
44.4%
184O3 Mini (Jan 31, 2025, low) · proprietary
44.4%
185DeepSeek R1 0528 Qwen3 8B · 8.2B
43.9%
186Claude Opus 4 (May 14, 2025) · proprietary
42.2%
187Claude Opus 4.1 (Aug 05, 2025) · proprietary
40.0%
188GPT 5.6 Luna None · proprietary
40.0%
189GPT 4.1 (Apr 14, 2025) · proprietary
38.3%
190DeepSeek v3 0324 · 684.5B
37.8%
191Gemini 3.1 Flash Lite (minimal) · proprietary
37.8%
192GPT 4.5 Preview (Feb 27, 2025) · proprietary
37.8%
193GPT 5.1 2025 11.13 None · proprietary
37.8%
194Claude Haiku 4.5 (Oct 01, 2025) · proprietary
35.8%
195Claude Sonnet 4.5 (Sep 29, 2025) · proprietary
35.6%
196GPT 5 Nano (Aug 07, 2025, minimal) · proprietary
35.6%
197Mistral Medium 2505 · proprietary
32.2%
198Gemini 2.0 Flash 001 · proprietary
31.1%
199O1 Preview (Sep 12, 2024) · proprietary
31.1%
200Mistral Small 3.2 2506 · proprietary
30.3%
201Magistral Small 2506 · 23.6B
30.0%
202Claude Sonnet 4 (May 14, 2025) · proprietary
28.9%
203GPT 4.1 Nano (Apr 14, 2025) · proprietary
28.9%
204Magistral Small 2509 · proprietary
28.1%
205GPT 5.4 Mini 2026 03.17 None · proprietary
26.7%
206Gemini 1.5 Pro 002 · proprietary
23.1%
207Gemma 3 27B IT · 27.4B
22.5%
208Claude 3.7 Sonnet (Feb 19, 2025) · proprietary
21.9%
209DeepSeek R1 Distill Qwen 1.5B · 1.8B
21.4%
210Llama 4 Maverick 17B 128E Instruct · 401.6B
20.6%
211Qwen Plus (Jan 25, 2025) · proprietary
17.8%
212Gemma 3 12B IT · 12.2B
16.7%
213Gemini 1.5 Flash 002 · proprietary
16.3%
214Qwen Max (Jan 25, 2025) · proprietary
16.1%
215DeepSeek v3 · 684.5B
15.8%
216Phi 4 · 14.7B
13.8%
217Grok 2 (Dec 12) · proprietary
11.5%
218Llama 3.1 405B Instruct · 405.9B
9.7%
219Claude 3.5 Sonnet (Oct 22, 2024) · proprietary
8.5%
220Mistral Large 2407 · proprietary
8.5%
221Qwen2.5 72B Instruct · 72.7B
8.1%
222Qwen3 1.7B · 2.0B
8.1%
223Llama 4 Scout 17B 16E Instruct · 108.6B
7.8%
224Mistral Large 2411 · proprietary
7.8%
225Gemma 3 4B IT · 4.3B
7.5%
226Qwen2.5 32B Instruct · 32.8B
7.4%
227GPT 4o Mini (Jul 18, 2024) · proprietary
6.9%
228Gemini 1.5 Pro 001 · proprietary
6.8%
229GPT 4 Turbo (Apr 09, 2024) · proprietary
6.7%
230Mistral Small 3 2501 · proprietary
6.7%
231Claude 3.5 Sonnet (Jun 20, 2024) · proprietary
6.5%
232GPT 4o (Aug 06, 2024) · proprietary
6.4%
233GPT 4o (May 13, 2024) · proprietary
6.3%
234GPT 4o (Nov 20, 2024) · proprietary
6.3%
235Qwen Turbo (Nov 01, 2024) · proprietary
6.1%
236Mistral Small 2503 · proprietary
5.8%
237Mistral Small 2501 · proprietary
5.3%
238Llama 3.3 70B Instruct · 70.6B
5.1%
239Claude 3 Opus (Feb 29, 2024) · proprietary
4.7%
240Gemini 1.5 Flash 8B 001 · proprietary
4.6%
241Llama 3.1 Tulu 3 70B DPO · 70.6B
4.4%
242Claude 3.5 Haiku (Oct 22, 2024) · proprietary
4.3%
243Meta Llama 3 70B Instruct · 70.6B
4.3%
244Gemini 1.5 Flash 001 · proprietary
3.9%
245Mistral Small 3.1 2503 · proprietary
3.9%
246Llama 3.1 70B Instruct · 70.6B
3.6%
247Granite 4.0 Micro · 3.4B
2.8%
248Llama 3.2 90B Vision Instruct · 88.6B
2.6%
249Claude 2.0 · proprietary
2.5%
250Claude 3 Sonnet (Feb 29, 2024) · proprietary
2.5%
251Hermes 2 Theta Llama 3 70B · 70.6B
2.5%
252Qwen2.5 7B Instruct · 7.6B
2.5%
253GPT 3.5 Turbo (Jan 25) · proprietary
2.2%
254Claude 2.1 · proprietary
1.9%
255Meta Llama 3 8B Instruct · 8.0B
1.9%
256Mistral Large 2402 · proprietary
1.9%
257Claude 3 Haiku (Mar 07, 2024) · proprietary
1.8%
258Llama 3.1 8B Instruct · 8.0B
1.7%
259Gemma 2 27B IT · 27.2B
1.4%
260Gemini 1.0 Pro 001 · proprietary
1.1%
261Gemma 3 1B IT · 1000M
1.1%
262GPT 4 (Jun 13) · proprietary
1.1%
263Deepseek Llm 67B Chat · 67B
0.8%
264Granite 4.0 1B · proprietary
0.8%
265Gemma 2 9B IT · 9.2B
0.6%
266GPT 4 (Mar 14) · proprietary
0.6%
267Llama 3.2 1B Instruct · 1.2B
0.6%
268Granite 4.0 350M · proprietary
0.3%
269Mistral 7B Instruct v0.3 · 7.2B
0.3%
270Llama 2 70B Chat HF · 69.0B
0.0%

Score vs model size

Which models give the most quality for their size — the ones worth running locally.

1B10B100B1Tmodel size (log scale) →98.6%0.0%Kimi K3 · 2.8T · 97.2%Kimi K2.7 Code · 1T · 95.6%GLM 5.3 Flash · 321B · 93.9%GLM 5.1 · 754B · 93.3%Kimi K2.5 · 1T · 92.2%GLM 5.3 · 753B · 91.1%Inkling Small · 266B · 90.0%GPT OSS 120B · 117B · 88.9%Qwen3.5 397B A17B · 403B · 88.9%Inkling · 952B · 88.9%Qwen3 235B A22B Thinking 2507 · 235B · 86.7%Qwen3.6 35B A3B · 36B · 86.7%GLM 5.2 · 753B · 86.4%GLM 4.7 · 358B · 83.3%Kimi K2 Thinking · 1T · 83.1%GLM 5 · 754B · 80.0%Gemma 4 31B IT · 31B · 73.3%MiniMax M3 · 427B · 71.1%Qwen3 30B A3B Thinking 2507 · 31B · 70.3%Seed OSS 36B Instruct · 36B · 67.5%Qwen3 32B · 33B · 66.9%DeepSeek R1 0528 · 685B · 66.4%GPT OSS 20B · 21B · 65.3%Qwen3 30B A3B · 31B · 62.8%Qwen3 30B A3B Instruct 2507 · 31B · 62.2%QwQ 32B · 33B · 59.2%GLM 4.7 Flash · 31B · 58.3%DeepSeek R1 Distill Qwen 32B · 33B · 55.6%DeepSeek R1 · 685B · 53.3%DeepSeek R1 Distill Llama 70B · 71B · 51.4%DeepSeek R1 Distill Qwen 14B · 15B · 50.6%DeepSeek R1 0528 Qwen3 8B · 8B · 43.9%DeepSeek v3 0324 · 685B · 37.8%Magistral Small 2506 · 24B · 30.0%Gemma 3 27B IT · 27B · 22.5%Llama 4 Maverick 17B 128E Instruct · 402B · 20.6%Gemma 3 12B IT · 12B · 16.7%DeepSeek v3 · 685B · 15.8%Phi 4 · 15B · 13.8%Llama 3.1 405B Instruct · 406B · 9.7%Qwen2.5 72B Instruct · 73B · 8.1%Qwen3 1.7B · 2B · 8.1%Llama 4 Scout 17B 16E Instruct · 109B · 7.8%Gemma 3 4B IT · 4B · 7.5%Qwen2.5 32B Instruct · 33B · 7.4%Llama 3.3 70B Instruct · 71B · 5.1%Llama 3.1 Tulu 3 70B DPO · 71B · 4.4%Meta Llama 3 70B Instruct · 71B · 4.3%Llama 3.1 70B Instruct · 71B · 3.6%Granite 4.0 Micro · 3B · 2.8%Llama 3.2 90B Vision Instruct · 89B · 2.6%Hermes 2 Theta Llama 3 70B · 71B · 2.5%Qwen2.5 7B Instruct · 8B · 2.5%Meta Llama 3 8B Instruct · 8B · 1.9%Llama 3.1 8B Instruct · 8B · 1.7%Gemma 2 27B IT · 27B · 1.4%Deepseek Llm 67B Chat · 67B · 0.8%Gemma 2 9B IT · 9B · 0.6%Llama 3.2 1B Instruct · 1B · 0.6%Mistral 7B Instruct v0.3 · 7B · 0.3%Llama 2 70B Chat HF · 69B · 0.0%Gemma 3 1B IT · 1000M · 1.1%Gemma 3 1B ITDeepSeek R1 Distill Qwen 1.5B · 2B · 21.4%DeepSeek R1 Distill Q…Qwen3 4B Instruct 2507 · 4B · 52.2%Qwen3.5 4B · 5B · 55.8%Qwen3.5 4BQwen3 8B · 8B · 56.1%Qwen3 8BQwen3.5 9B · 10B · 61.7%Qwen3.5 9BQwen3 14B · 15B · 66.4%Qwen3 14BGemma 4 26B A4B IT · 26B · 82.2%Gemma 4 26B A4B ITQwen3.6 27B · 28B · 91.1%Qwen3.6 27BDeepSeek V4 Flash 0731 · 304B · 94.4%DeepSeek V4 Flash 0731Kimi K2.6 · 1T · 96.1%DeepSeek V4 Pro · 1.6T · 96.7%DeepSeek V4 ProDeepSeek V4 Pro 0813 · 1.7T · 98.6%DeepSeek V4 Pro 0813
Each dot is a model. Up = higher score, left = smaller (easier to run locally). The dashed line marks the efficiency frontier — the best score you can get at each size or smaller.
  • Gemma 3 1B IT, 1000M, score 1.1% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek R1 Distill Qwen 1.5B, 2B, score 21.4% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3 4B Instruct 2507, 4B, score 52.2% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3.5 4B, 5B, score 55.8% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3 8B, 8B, score 56.1% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3.5 9B, 10B, score 61.7% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3 14B, 15B, score 66.4% — on the efficiency frontier (best score at its size or smaller).
  • Gemma 4 26B A4B IT, 26B, score 82.2% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3.6 27B, 28B, score 91.1% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek V4 Flash 0731, 304B, score 94.4% — on the efficiency frontier (best score at its size or smaller).
  • Kimi K2.6, 1T, score 96.1% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek V4 Pro, 1.6T, score 96.7% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek V4 Pro 0813, 1.7T, score 98.6% — on the efficiency frontier (best score at its size or smaller).

AIME 2024/2025: frequently asked questions

What is the best open LLM on AIME 2024/2025?
DeepSeek V4 Pro 0813 is the top open model on AIME 2024/2025, scoring 98.6%. Among all models tested — including proprietary ones — it ranks #12. The top model overall is GPT 6 Astra Max (OpenAI) at 100.0%.
What's the best AIME 2024/2025 model you can run on a 24 GB GPU?
Qwen3.6 27B is the highest-scoring open model that fits in 24 GB at 4-bit quantization (about 15 GB), scoring 91.1% on AIME 2024/2025.
What's the best AIME 2024/2025 model you can run on a 12 GB GPU?
Qwen3 14B is the highest-scoring open model that fits in 12 GB at 4-bit quantization (about 8 GB), scoring 66.4% on AIME 2024/2025.
Can open models match proprietary models on AIME 2024/2025?
Not quite on AIME 2024/2025: the strongest proprietary model (GPT 6 Astra Max) scores 100.0%, ahead of the best open model (DeepSeek V4 Pro 0813) at 98.6% — but you can run the open one yourself.

Scores aggregated from epoch. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.