Reasoning

GPQA Diamond Leaderboard

GPQA Diamond is a set of extremely hard, graduate-level science questions (physics, chemistry, biology) written by domain experts and filtered so that skilled non-experts with web access still fail. It measures genuine reasoning rather than memorization.

Source: epoch83 open models ranked+208 proprietaryData through Sep 2026

All models ranked on GPQA Diamond

Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.

#ModelScore
1GPT 6 Astra Max · proprietary
95.8%
2Gemini 3.7 Flash (high) · proprietary
94.8%
3GPT 5.4 Pro (Mar 05, 2026, xhigh) · proprietary
94.6%
4Gemini 3.1 Pro Preview (high) · proprietary
94.4%
5Gemini 3.6 Flash (high) · proprietary
94.1%
6Gemini 3.1 Pro Preview · proprietary
94.1%
7GPT 5.5 Pre Release (xhigh) · proprietary
94.0%
8Grok 4.6 (high) · proprietary
94.0%
9GPT 5.5 Pro Pre Release (xhigh) · proprietary
93.9%
10Claude Opus 5 Max · proprietary
93.9%
11GPT 5.6 Sol Max · proprietary
93.5%
12Grok 4.5 (high) · proprietary
93.4%
13GPT 5.6 Terra Max · proprietary
93.3%
14GPT 5.4 (Mar 05, 2026, xhigh) · proprietary
93.3%
15Grok 4.6 (xhigh) · proprietary
93.2%
16Kimi K3 · 2779.9B
93.1%
17Claude Opus 5 · proprietary
92.9%
18Gemini 3.5 Flash (high) · proprietary
92.8%
19Qwen3.8 Max (xhigh) · proprietary
92.7%
20Gemini 3 Pro Preview · proprietary
92.6%
21GLM 5.2 · 753.3B
91.9%
22DeepSeek V4 Pro 0813 · 1650.5B
91.7%
23GPT 5.6 Luna Max · proprietary
91.6%
24GPT 5.2 (Dec 11, 2025, xhigh) · proprietary
91.4%
25Claude Opus 4.8 Max · proprietary
91.0%
26DeepSeek V4 Flash 0731 · 304.2B
91.0%
27DeepSeek V4 Pro · 1598.8B
90.9%
28GLM 5.3 · 753.3B
90.9%
29MiniMax M3 · 427.0B
90.9%
30Qwen3.7 Max · proprietary
90.9%
31Kimi K2.6 · 1026.9B
90.8%
32GPT 5.5 (low) · proprietary
90.7%
33Claude Opus 4.6 (32K) · proprietary
90.5%
34Claude Sonnet 5 (xhigh) · proprietary
90.5%
35Claude Opus 4.7 (xhigh) · proprietary
90.1%
36GLM 5.3 Flash · 321.3B
90.1%
37GLM 5.1 · 753.9B
89.9%
38GPT 5.4 (Mar 05, 2026, high) · proprietary
89.9%
39GPT 5.6 Sol (low) · proprietary
89.9%
40Muse Spark · proprietary
89.8%
41Gemini 3 Flash Preview (high) · proprietary
89.4%
42Grok 4.20 0309 Reasoning · proprietary
89.3%
43Gemini 3.5 Flash (low) · proprietary
88.9%
44GPT 5.4 (Mar 05, 2026, medium) · proprietary
88.9%
45Grok 4.3 (high) · proprietary
88.8%
46Claude Opus 4.6 (64K) · proprietary
88.8%
47Inkling Small · 266.0B
88.5%
48Claude Opus 4.6 Max · proprietary
88.4%
49Claude Opus 4.8 (low) · proprietary
88.4%
50Qwen3.6 Plus · proprietary
88.4%
51Inkling · 952.4B
88.3%
52GPT 5.2 (Dec 11, 2025, high) · proprietary
88.2%
53Claude Opus 5 (low) · proprietary
87.9%
54GPT 5.2 (Dec 11, 2025, medium) · proprietary
87.9%
55Kimi K2.7 Code · 1026.9B
87.9%
56Qwen3.7 Plus · proprietary
87.9%
57GLM 5 · 753.9B
87.8%
58GPT 5.1 (Nov 13, 2025, high) · proprietary
87.6%
59Kimi K2.5 · 1026.9B
87.6%
60Claude Sonnet 4.6 (32K) · proprietary
87.4%
61GPT 5.6 Terra (low) · proprietary
87.4%
62Qwen3.6 Max Preview · proprietary
87.4%
63Grok 4 (Jul 09) · proprietary
87.0%
64GPT 5.4 Mini (Mar 17, 2026, xhigh) · proprietary
86.9%
65Claude Opus 4.7 Max · proprietary
86.4%
66Gemini 3.5 Flash (minimal) · proprietary
86.4%
67Gemini 3.6 Flash (low) · proprietary
86.4%
68Qwen3.5 397B A17B · 403.4B
86.4%
69GPT 5 (Aug 07, 2025, high) · proprietary
86.2%
70Claude Opus 4.5 (Nov 01, 2025, 32K) · proprietary
86.1%
71Claude Fable 5 Max · proprietary
85.9%
72Gemini 3.6 Flash (minimal) · proprietary
85.9%
73Qwen3.6 27B · 27.8B
85.9%
74Claude Opus 4.5 (Nov 01, 2025, 16K) · proprietary
85.5%
75Claude Opus 4.8 None · proprietary
85.4%
76GPT 5 (Aug 07, 2025, medium) · proprietary
85.4%
77Nemotron 3 Ultra · proprietary
85.4%
78Gemini 2.5 Pro · proprietary
85.3%
79GPT 5.1 (Nov 13, 2025, medium) · proprietary
85.0%
80Gemini 2.5 Pro Preview (Jun 05) · proprietary
84.9%
81GPT 5.4 (Mar 05, 2026, low) · proprietary
84.9%
82Qwen3.5 Plus · proprietary
84.9%
83Qwen3.6 35B A3B · 36.0B
84.9%
84Kimi K2 Thinking · 1026.4B
84.2%
85Gemini 2.5 Pro Exp (Mar 25) · proprietary
83.8%
86GPT 5.4 Mini (Mar 17, 2026, high) · proprietary
83.6%
87Qwen3.5 35B A3B · proprietary
83.5%
88DeepSeek Reasoner · proprietary
83.4%
89Claude Fable 5 (high) · proprietary
83.3%
90Claude Sonnet 4.6 (high) · proprietary
83.3%
91Claude Sonnet 4.6 (medium) · proprietary
83.3%
92Gemini 3.5 Flash Lite (high) · proprietary
83.3%
93GLM 4.7 · 358.3B
83.3%
94Qwen3.6 Flash · proprietary
83.3%
95Gemini 3 Flash Preview · proprietary
83.2%
96GPT 5.6 Sol None · proprietary
82.8%
97GPT 5.2 (Dec 11, 2025, low) · proprietary
82.7%
98GPT 5.5 Instant · proprietary
82.5%
99Claude Sonnet 4.5 (Sep 29, 2025, 59K) · proprietary
82.3%
100GPT 5.6 Luna (low) · proprietary
82.3%
101Qwen3.5 Flash · proprietary
82.3%
102Qwen3.7 Flash · proprietary
82.3%
103Gemini 3.1 Flash Lite (high) · proprietary
81.8%
104O3 (Apr 16, 2025, high) · proprietary
81.8%
105Qwen3.7 Plus None · proprietary
81.8%
106Claude Sonnet 4.5 (Sep 29, 2025, 32K) · proprietary
81.7%
107Qwen3.5 35B A3B None · proprietary
81.2%
108O3 (Apr 16, 2025, medium) · proprietary
80.8%
109Qwen3.7 Flash None · proprietary
80.8%
110Claude Opus 4.5 (Nov 01, 2025) · proprietary
80.7%
111Claude Sonnet 5 Max · proprietary
80.3%
112Qwen3 235B A22B Thinking 2507 · 235.1B
80.0%
113O3 (Apr 16, 2025, low) · proprietary
79.8%
114O4 Mini (Apr 16, 2025, high) · proprietary
79.6%
115Qwen3.5 9B · 9.7B
79.0%
116Claude Fable 5 (low) · proprietary
78.8%
117Claude Sonnet 4.5 (Sep 29, 2025, 16K) · proprietary
78.8%
118Claude Sonnet 4.6 Max · proprietary
78.8%
119Claude 3.7 Sonnet (Feb 19, 2025, 64K) · proprietary
78.5%
120GPT 5.4 Nano (Mar 17, 2026, high) · proprietary
78.5%
121Claude Sonnet 4 (May 14, 2025, 32K) · proprietary
78.3%
122Claude Sonnet 4 (May 14, 2025, 59K) · proprietary
77.8%
123O4 Mini (Apr 16, 2025, medium) · proprietary
77.8%
124Claude Opus 4.1 (Aug 05, 2025, 16K) · proprietary
77.3%
125GPT 5.5 None · proprietary
77.3%
126GPT 5.6 Terra None · proprietary
77.3%
127O3 Mini (Jan 31, 2025, high) · proprietary
77.0%
128Claude 3.7 Sonnet (Feb 19, 2025, 16K) · proprietary
76.8%
129Claude 3.7 Sonnet (Feb 19, 2025, 32K) · proprietary
76.8%
130Claude Opus 4.1 (Aug 05, 2025, 27K) · proprietary
76.8%
131O1 (Dec 17, 2024, high) · proprietary
76.8%
132DeepSeek R1 0528 · 684.5B
76.3%
133Claude Opus 4 (May 14, 2025, 16K) · proprietary
76.3%
134Grok 3 Mini Beta (low) · proprietary
76.3%
135Claude Sonnet 4 (May 14, 2025, 16K) · proprietary
75.8%
136Gemini 3.5 Flash Lite (low) · proprietary
75.8%
137Gemma 4 31B IT · 31.3B
75.8%
138GPT OSS 120B · 116.8B
75.8%
139O1 (Dec 17, 2024, medium) · proprietary
75.8%
140O4 Mini (Apr 16, 2025, low) · proprietary
75.3%
141GPT 5 Mini (Aug 07, 2025, high) · proprietary
75.0%
142GPT 5.4 2026 03.05 None · proprietary
74.8%
143Grok 3 Mini Beta (high) · proprietary
74.6%
144O3 Mini (Jan 31, 2025, medium) · proprietary
74.3%
145Gemini 3.1 Flash Lite (low) · proprietary
74.2%
146Gemini 3.5 Flash Lite (minimal) · proprietary
74.2%
147O1 (Dec 17, 2024, low) · proprietary
74.2%
148Claude Sonnet 4.5 (Sep 29, 2025) · proprietary
73.7%
149Gemini 3.1 Flash Lite (minimal) · proprietary
73.7%
150Claude Opus 4.1 (Aug 05, 2025) · proprietary
73.2%
151Gemma 4 26B A4B IT · 25.8B
73.2%
152GPT 5.2 2025 12.11 None · proprietary
73.2%
153Qwen3 Max (Sep 23, 2025) · proprietary
72.6%
154GPT 5.4 Nano (Mar 17, 2026, low) · proprietary
72.2%
155GPT 5 (Aug 07, 2025, minimal) · proprietary
71.7%
156GPT 5 Mini (Aug 07, 2025, minimal) · proprietary
71.7%
157GPT 5 Mini (Aug 07, 2025, medium) · proprietary
71.7%
158Seed OSS 36B Instruct · 36.2B
71.5%
159Claude Haiku 4.5 (Oct 01, 2025, 32K) · proprietary
71.2%
160DeepSeek Chat · proprietary
71.2%
161Qwen3 235B A22B · 235.1B
70.7%
162Qwen3 30B A3B Thinking 2507 · 30.5B
70.1%
163GPT 5 Nano (Aug 07, 2025, high) · proprietary
69.4%
164DeepSeek R1 · 684.5B
69.2%
165Claude Opus 4 (May 14, 2025) · proprietary
69.2%
166GPT 4.5 Preview (Feb 27, 2025) · proprietary
68.7%
167O3 Mini (Jan 31, 2025, low) · proprietary
68.2%
168DeepSeek v3 0324 · 684.5B
67.6%
169Grok 3 Beta · proprietary
67.6%
170GPT 5 Nano (Aug 07, 2025, medium) · proprietary
67.4%
171Llama 4 Maverick 17B 128E Instruct · 401.6B
67.0%
172GPT 4.1 (Apr 14, 2025) · proprietary
66.9%
173Claude Sonnet 4 (May 14, 2025) · proprietary
66.7%
174Gemini 2.5 Pro Preview (May 06) · proprietary
66.7%
175GPT 5.1 2025 11.13 None · proprietary
66.7%
176Claude 3.7 Sonnet (Feb 19, 2025) · proprietary
66.0%
177GPT 4.1 Mini (Apr 14, 2025) · proprietary
65.8%
178Qwen3 32B · 32.8B
65.7%
179Gemini 2.0 Pro Exp (Feb 05) · proprietary
65.7%
180QwQ Plus · proprietary
65.4%
181QwQ 32B · 32.8B
65.3%
182DeepSeek R1 Distill Qwen 32B · 32.8B
64.1%
183Gemini 2.0 Flash 001 · proprietary
64.1%
184GPT 5.4 Mini 2026 03.17 None · proprietary
64.1%
185Qwen3 14B · 14.8B
63.8%
186GPT 5.6 Luna None · proprietary
63.6%
187O1 Mini (Sep 12, 2024, high) · proprietary
62.4%
188Qwen3 30B A3B · 30.5B
61.7%
189GPT OSS 20B · 20.9B
60.8%
190GLM 4.7 Flash · 31.2B
60.5%
191Claude Haiku 4.5 (Oct 01, 2025) · proprietary
60.5%
192Mistral Medium 2505 · proprietary
59.5%
193O1 Mini (Sep 12, 2024, medium) · proprietary
59.5%
194GPT 5 Nano (Aug 07, 2025, low) · proprietary
57.6%
195Gemini 1.5 Pro 002 · proprietary
57.2%
196Gemini 2.0 Flash Thinking Exp (Jan 21) · proprietary
57.1%
197Qwen3 8B · 8.2B
56.8%
198DeepSeek v3 · 684.5B
56.5%
199Qwen Max (Jan 25, 2025) · proprietary
56.1%
200Magistral Small 2506 · 23.6B
56.1%
201Phi 4 · 14.7B
56.1%
202DeepSeek R1 Distill Llama 70B · 70.6B
55.7%
203Qwen3 30B A3B Instruct 2507 · 30.5B
55.6%
204GPT 5.4 Nano 2026 03.17 None · proprietary
55.6%
205Claude 3.5 Sonnet (Oct 22, 2024) · proprietary
55.3%
206Claude 3.5 Sonnet (Jun 20, 2024) · proprietary
54.0%
207Grok 2 (Dec 12) · proprietary
53.8%
208Qwen3 4B · 4.0B
52.3%
209Llama 4 Scout 17B 16E Instruct · 108.6B
51.8%
210Mistral Large 2411 · proprietary
51.3%
211Llama 3.1 405B Instruct · 405.9B
50.9%
212O1 Preview (Sep 12, 2024) · proprietary
50.3%
213GPT 4o (Aug 06, 2024) · proprietary
49.2%
214Qwen2.5 72B Instruct · 72.7B
49.1%
215Mistral Small 3.2 2506 · proprietary
49.0%
216Mistral Large 2407 · proprietary
49.0%
217GPT 4.1 Nano (Apr 14, 2025) · proprietary
48.9%
218GPT 4o (May 13, 2024) · proprietary
48.9%
219GPT 5 Nano (Aug 07, 2025, minimal) · proprietary
48.5%
220Qwen Plus (Jan 25, 2025) · proprietary
48.1%
221GPT 4o (Nov 20, 2024) · proprietary
47.9%
222Gemma 3 27B IT · 27.4B
47.7%
223Magistral Small 2509 · proprietary
47.6%
224Mistral Small 2503 · proprietary
47.5%
225Llama 3.3 70B Instruct · 70.6B
47.4%
226Gemini 1.5 Flash 002 · proprietary
47.3%
227Mistral Small 3 2501 · proprietary
47.3%
228Claude 3 Opus (Feb 29, 2024) · proprietary
47.2%
229GPT 4 Turbo (Apr 09, 2024) · proprietary
46.6%
230Llama 3.1 Tulu 3 70B DPO · 70.6B
46.3%
231Qwen2.5 32B Instruct · 32.8B
46.1%
232Gemini 1.5 Pro 001 · proprietary
45.9%
233Qwen3 4B Instruct 2507 · 4.0B
45.8%
234Mistral Small 2501 · proprietary
45.3%
235DeepSeek R1 Distill Qwen 14B · 14.8B
44.7%
236Llama 3.1 70B Instruct · 70.6B
44.2%
237WizardLM 2 8x22B · 140.6B
43.4%
238GPT 4 1106 Preview · proprietary
42.4%
239GPT 4 0125 Preview · proprietary
42.3%
240Mistral Small 3.1 2503 · proprietary
41.9%
241Qwen Turbo (Nov 01, 2024) · proprietary
41.8%
242Llama 3.2 90B Vision Instruct · 88.6B
41.0%
243Qwen2 72B Instruct · 72.7B
40.8%
244Claude 3 Sonnet (Feb 29, 2024) · proprietary
40.6%
245Meta Llama 3 70B Instruct · 70.6B
40.6%
246Gemini 1.5 Flash 001 · proprietary
40.4%
247Gemma 3 12B IT · 12.2B
39.5%
248Mistral Large 2402 · proprietary
38.8%
249Claude 3.5 Haiku (Oct 22, 2024) · proprietary
38.1%
250Qwen3 1.7B · 2.0B
38.0%
251GPT 4o Mini (Jul 18, 2024) · proprietary
37.7%
252Hermes 2 Theta Llama 3 70B · 70.6B
37.5%
253Gemma 2 27B IT · 27.2B
36.5%
254Claude 3 Haiku (Mar 07, 2024) · proprietary
36.3%
255GPT 4 (Mar 14) · proprietary
35.7%
256Qwen2.5 7B Instruct · 7.6B
35.5%
257Claude 2.0 · proprietary
34.7%
258Open Mixtral 8x22b · proprietary
34.1%
259Gemini 1.0 Pro 001 · proprietary
34.0%
260Eurus 2 7B PRIME · 7.6B
33.9%
261DeepSeek R1 Distill Qwen 1.5B · 1.8B
33.6%
262Claude 2.1 · proprietary
33.0%
263Gemini 1.5 Flash 8B 001 · proprietary
33.0%
264Dbrx Instruct · proprietary
32.9%
265Yi 1.5 34B Chat · 34.4B
32.0%
266Qwen1.5 32B Chat · 32.5B
30.7%
267GPT 4 (Jun 13) · proprietary
30.6%
268Mixtral 8x7B Instruct v0.1 · 46.7B
30.6%
269Open Mistral Nemo 2407 · proprietary
29.9%
270Open Mixtral 8x7b · proprietary
29.8%
271Qwen1.5 72B Chat · 72.3B
28.8%
272Granite 4.0 Micro · 3.4B
28.3%
273GPT 3.5 Turbo (Nov 06) · proprietary
28.0%
274Phi 3 Medium 128K Instruct · proprietary
27.6%
275Gemma 2 9B IT · 9.2B
27.5%
276GPT 3.5 Turbo (Jan 25) · proprietary
27.2%
277Ministral 8B 2410 · proprietary
27.2%
278Llama 3.1 8B Instruct · 8.0B
27.0%
279Llama 2 70B Chat HF · 69.0B
26.3%
280Meta Llama 3 8B Instruct · 8.0B
26.1%
281Ministral 3B 2410 · proprietary
25.3%
282Deepseek Llm 67B Chat · 67B
24.6%
283Granite 4.0 1B · proprietary
24.0%
284Llama 3.2 1B Instruct · 1.2B
23.9%
285Gemma 3 4B IT · 4.3B
23.2%
286Gemma 3 1B IT · 1000M
20.0%
287Mistral 7B Instruct v0.3 · 7.2B
15.2%
288Yi 34B Chat · 34.4B
14.7%
289Open Mistral 7B · proprietary
13.2%
290Granite 4.0 350M · proprietary
11.2%
291DeepSeek R1 0528 Qwen3 8B · 8.2B
9.3%

Score vs model size

Which models give the most quality for their size — the ones worth running locally.

1B10B100B1Tmodel size (log scale) →93.1%9.3%DeepSeek V4 Pro 0813 · 1.7T · 91.7%DeepSeek V4 Pro · 1.6T · 90.9%MiniMax M3 · 427B · 90.9%GLM 5.3 · 753B · 90.9%Kimi K2.6 · 1T · 90.8%GLM 5.3 Flash · 321B · 90.1%GLM 5.1 · 754B · 89.9%Inkling · 952B · 88.3%Kimi K2.7 Code · 1T · 87.9%GLM 5 · 754B · 87.8%Kimi K2.5 · 1T · 87.6%Qwen3.5 397B A17B · 403B · 86.4%Qwen3.6 35B A3B · 36B · 84.9%Kimi K2 Thinking · 1T · 84.2%GLM 4.7 · 358B · 83.3%Qwen3 235B A22B Thinking 2507 · 235B · 80.0%DeepSeek R1 0528 · 685B · 76.3%Gemma 4 31B IT · 31B · 75.8%GPT OSS 120B · 117B · 75.8%Gemma 4 26B A4B IT · 26B · 73.2%Seed OSS 36B Instruct · 36B · 71.5%Qwen3 235B A22B · 235B · 70.7%Qwen3 30B A3B Thinking 2507 · 31B · 70.1%DeepSeek R1 · 685B · 69.2%DeepSeek v3 0324 · 685B · 67.6%Llama 4 Maverick 17B 128E Instruct · 402B · 67.0%Qwen3 32B · 33B · 65.7%QwQ 32B · 33B · 65.3%DeepSeek R1 Distill Qwen 32B · 33B · 64.1%Qwen3 14B · 15B · 63.8%Qwen3 30B A3B · 31B · 61.7%GPT OSS 20B · 21B · 60.8%GLM 4.7 Flash · 31B · 60.5%DeepSeek v3 · 685B · 56.5%Phi 4 · 15B · 56.1%Magistral Small 2506 · 24B · 56.1%DeepSeek R1 Distill Llama 70B · 71B · 55.7%Qwen3 30B A3B Instruct 2507 · 31B · 55.6%Llama 4 Scout 17B 16E Instruct · 109B · 51.8%Llama 3.1 405B Instruct · 406B · 50.9%Qwen2.5 72B Instruct · 73B · 49.1%Gemma 3 27B IT · 27B · 47.7%Llama 3.3 70B Instruct · 71B · 47.4%Llama 3.1 Tulu 3 70B DPO · 71B · 46.3%Qwen2.5 32B Instruct · 33B · 46.1%Qwen3 4B Instruct 2507 · 4B · 45.8%DeepSeek R1 Distill Qwen 14B · 15B · 44.7%Llama 3.1 70B Instruct · 71B · 44.2%WizardLM 2 8x22B · 141B · 43.4%Llama 3.2 90B Vision Instruct · 89B · 41.0%Qwen2 72B Instruct · 73B · 40.8%Meta Llama 3 70B Instruct · 71B · 40.6%Gemma 3 12B IT · 12B · 39.5%Hermes 2 Theta Llama 3 70B · 71B · 37.5%Gemma 2 27B IT · 27B · 36.5%Qwen2.5 7B Instruct · 8B · 35.5%Eurus 2 7B PRIME · 8B · 33.9%Yi 1.5 34B Chat · 34B · 32.0%Qwen1.5 32B Chat · 33B · 30.7%Mixtral 8x7B Instruct v0.1 · 47B · 30.6%Qwen1.5 72B Chat · 72B · 28.8%Granite 4.0 Micro · 3B · 28.3%Gemma 2 9B IT · 9B · 27.5%Llama 3.1 8B Instruct · 8B · 27.0%Llama 2 70B Chat HF · 69B · 26.3%Meta Llama 3 8B Instruct · 8B · 26.1%Deepseek Llm 67B Chat · 67B · 24.6%Gemma 3 4B IT · 4B · 23.2%Mistral 7B Instruct v0.3 · 7B · 15.2%Yi 34B Chat · 34B · 14.7%DeepSeek R1 0528 Qwen3 8B · 8B · 9.3%Gemma 3 1B IT · 1000M · 20.0%Llama 3.2 1B Instruct · 1B · 23.9%Llama 3.2 1B InstructDeepSeek R1 Distill Qwen 1.5B · 2B · 33.6%DeepSeek R1 Distill Q…Qwen3 1.7B · 2B · 38.0%Qwen3 1.7BQwen3 4B · 4B · 52.3%Qwen3 4BQwen3 8B · 8B · 56.8%Qwen3 8BQwen3.5 9B · 10B · 79.0%Qwen3.5 9BQwen3.6 27B · 28B · 85.9%Qwen3.6 27BInkling Small · 266B · 88.5%Inkling SmallDeepSeek V4 Flash 0731 · 304B · 91.0%DeepSeek V4 Flash 0731GLM 5.2 · 753B · 91.9%GLM 5.2Kimi K3 · 2.8T · 93.1%Kimi K3
Each dot is a model. Up = higher score, left = smaller (easier to run locally). The dashed line marks the efficiency frontier — the best score you can get at each size or smaller.
  • Gemma 3 1B IT, 1000M, score 20.0% — on the efficiency frontier (best score at its size or smaller).
  • Llama 3.2 1B Instruct, 1B, score 23.9% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek R1 Distill Qwen 1.5B, 2B, score 33.6% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3 1.7B, 2B, score 38.0% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3 4B, 4B, score 52.3% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3 8B, 8B, score 56.8% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3.5 9B, 10B, score 79.0% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3.6 27B, 28B, score 85.9% — on the efficiency frontier (best score at its size or smaller).
  • Inkling Small, 266B, score 88.5% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek V4 Flash 0731, 304B, score 91.0% — on the efficiency frontier (best score at its size or smaller).
  • GLM 5.2, 753B, score 91.9% — on the efficiency frontier (best score at its size or smaller).
  • Kimi K3, 2.8T, score 93.1% — on the efficiency frontier (best score at its size or smaller).

GPQA Diamond: frequently asked questions

What is the best open LLM on GPQA Diamond?
Kimi K3 is the top open model on GPQA Diamond, scoring 93.1%. Among all models tested — including proprietary ones — it ranks #16. The top model overall is GPT 6 Astra Max (OpenAI) at 95.8%.
What's the best GPQA Diamond model you can run on a 24 GB GPU?
Qwen3.6 27B is the highest-scoring open model that fits in 24 GB at 4-bit quantization (about 15 GB), scoring 85.9% on GPQA Diamond.
What's the best GPQA Diamond model you can run on a 12 GB GPU?
Qwen3.5 9B is the highest-scoring open model that fits in 12 GB at 4-bit quantization (about 5 GB), scoring 79.0% on GPQA Diamond.
Can open models match proprietary models on GPQA Diamond?
Not quite on GPQA Diamond: the strongest proprietary model (GPT 6 Astra Max) scores 95.8%, ahead of the best open model (Kimi K3) at 93.1% — but you can run the open one yourself.

Scores aggregated from epoch. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.