Best LLMs: open and proprietary

Open and proprietary models together on one 0–100 scale (overall capability). Switch to local models to see only what you can download and run.

40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built

Models ranked by overall llmrun Score
#Modelllmrun ScoreCodingAgentsMathScienceReasoningBenchmarksVRAM
121MiniMax M2.7open138 GB · 6 benchmarks41––35–6138 GB
122GPT 5.5 Instant7 benchmarks––4536–7–
123Qwen3.5 Flash10 benchmarks––47–4310–
124Gemini 2.5 Pro Preview (Mar 25)6 benchmarks––––376–
125Gemma 4 31B ITopen20.4 GB · 11 benchmarks47––32401120.4 GB
126Qwen3.6 Flash10 benchmarks––48–3510–
127Qwen3.5 35B A3Bopen22.0 GB · 8 benchmarks–––3437822.0 GB
128Claude Haiku 4.5 (Oct 01, 2025)8 benchmarks––44–408–
129Gemma 4 26B A4B ITopen16.1 GB · 9 benchmarks43––3033916.1 GB
130Mercury 24 benchmarks45––29–4–
131Claude Sonnet 4 (May 14, 2025)4 benchmarks43––––4–
132Gemini 2.5 Pro Preview (May 06)5 benchmarks–––27–5–
133Qwen3 Max (Sep 23, 2025)13 benchmarks––46–3613–
134Claude 3.7 Sonnet (Feb 19, 2025)4 benchmarks––––414–
135O1 (Dec 17, 2024)8 benchmarks––44–348–
136GPT 5.4 2026 03.056 benchmarks56–––336–
137MiniMax M2open138 GB · 5 benchmarks–31–––5138 GB
138DeepSeek R1 0528open415 GB · 11 benchmarks46–44–3211415 GB
139Qwen3.5 27Bopen17.4 GB · 6 benchmarks38–––41617.4 GB
140GLM 4.6open215 GB · 6 benchmarks3631–29–6215 GB
141Grok 3 Mini Beta5 benchmarks38–48––5–
142O3 Mini (Jan 31, 2025)18 benchmarks42–47323118–
143Gemini 2.5 Flash Preview (May 20)6 benchmarks––––366–
144Seed OSS 36B Instructopen22.3 GB · 4 benchmarks–––––422.3 GB
145Kimi K2 Instruct 0905open620 GB · 6 benchmarks40––––6620 GB
146Mistral Medium 26049 benchmarks41––30339–
147GPT 5 Nano (Aug 07, 2025)15 benchmarks42–48–2515–
148GLM 4.5open216 GB · 7 benchmarks3832–––7216 GB
149Qwen3 30B A3B Thinking 2507open18.7 GB · 8 benchmarks–––2827818.7 GB
150GPT 5.2 2025 12.116 benchmarks––––286–
151Kimi K2 Instructopen620 GB · 10 benchmarks4128––2510620 GB
152Gemini 2.5 Flash9 benchmarks–22––349–
153DeepSeek V3.1open415 GB · 7 benchmarks––––367415 GB
154Gemini 2.5 Flash Preview (Apr 17)5 benchmarks–––––5–
155Qwen3.5 9Bopen6.4 GB · 9 benchmarks–––323096.4 GB
156DeepSeek R1open415 GB · 14 benchmarks39–40282914415 GB
157DeepSeek Chat6 benchmarks––––236–
158Qwen3 235B A22B Instruct 2507open142 GB · 8 benchmarks41–––318142 GB
159Qwen3 32Bopen20.3 GB · 9 benchmarks33––2626920.3 GB
160Grok 3 Beta6 benchmarks––40––6–
161Qwen3 235B A22Bopen142 GB · 10 benchmarks41–––3110142 GB
162Qwen3 14Bopen9.5 GB · 8 benchmarks–––252489.5 GB
163GPT OSS 120Bopen70.5 GB · 20 benchmarks3714–31302070.5 GB
164DeepSeek R1 Distill Qwen 32Bopen20.5 GB · 4 benchmarks–––––420.5 GB
165Qwen3 30B A3B Instruct 2507open18.7 GB · 5 benchmarks––––26518.7 GB
166GLM 4.5 Airopen66.7 GB · 4 benchmarks–––––466.7 GB
167GPT OSS 20Bopen12.9 GB · 11 benchmarks40––24261112.9 GB
168QwQ 32Bopen20.5 GB · 6 benchmarks–––––620.5 GB
169NVIDIA Nemotron 3 Super 120B A12B BF16open74.7 GB · 4 benchmarks36––27–474.7 GB
170GPT 4.1 (Apr 14, 2025)17 benchmarks39–34262617–
171GPT 4.5 Preview (Feb 27, 2025)11 benchmarks36–33272811–
172Qwen3 30B A3Bopen18.7 GB · 7 benchmarks––––22718.7 GB
173Qwen3 8Bopen5.5 GB · 8 benchmarks–––212185.5 GB
174Grok 34 benchmarks––––264–
175GPT 5.4 Nano 2026 03.176 benchmarks––36–276–
176O1 Mini (Sep 12, 2024)6 benchmarks––36–226–
177DeepSeek v3 0324open415 GB · 13 benchmarks39–33272413415 GB
178GPT 5.1 2025 11.137 benchmarks–––26277–
179DeepSeek R1 Distill Qwen 14Bopen9.6 GB · 4 benchmarks––38––49.6 GB
180GPT 4.1 Mini (Apr 14, 2025)16 benchmarks32–36272616–
181Gemini 2.0 Flash Thinking Exp (Jan 21)6 benchmarks–––22–6–
182Gemini 2.0 Flash 0017 benchmarks––32–247–
183Mistral Medium 25086 benchmarks33––24266–
184O1 Preview (Sep 12, 2024)6 benchmarks––32–316–
185Gemini 2.0 Pro Exp (Feb 05)4 benchmarks–––––4–
186GPT 5.4 Mini 2026 03.176 benchmarks––30–296–
187Mistral Medium 25055 benchmarks––3323–5–
188Gemini 2.5 Flash Lite Preview Thinking (Jun 17)5 benchmarks35–––245–
189Mistral Large 3 675B Instruct 2512open446 GB · 5 benchmarks33––26255446 GB
190Magistral Small 2506open14.9 GB · 4 benchmarks––––24414.9 GB
191Claude 3.5 Sonnet (Oct 22, 2024)11 benchmarks382623212911–
192DeepSeek v3open415 GB · 10 benchmarks37–26222110415 GB
193Llama 4 Maverick 17B 128E Instructopen265 GB · 17 benchmarks25–29262317265 GB
194Qwen Max (Jan 25, 2025)5 benchmarks––27––5–
195Gemini 1.5 Pro 0029 benchmarks––2822219–
196Magistral Small 2509open15.1 GB · 6 benchmarks–––1822615.1 GB
197Mistral Small 3.2 24B Instruct 2506open15.1 GB · 6 benchmarks–––1822615.1 GB
198Phi 4open9.5 GB · 6 benchmarks––26––69.5 GB
199Grok 2 (Dec 12)6 benchmarks––25–246–
200Claude 3.5 Sonnet (Jun 20, 2024)7 benchmarks––22–267–
201Qwen2.5 72B Instructopen44.6 GB · 9 benchmarks––25–23944.6 GB
202Gemma 3 27B ITopen18.1 GB · 11 benchmarks18–2916171118.1 GB
203Llama 4 Scout 17B 16E Instructopen71.7 GB · 12 benchmarks––2418201271.7 GB
204Gemini 1.5 Flash 0026 benchmarks––25––6–
205GPT 4.1 Nano (Apr 14, 2025)13 benchmarks21–30171713–
206Llama 3.1 405B Instructopen268 GB · 8 benchmarks––22–228268 GB
207GPT 4o (May 13, 2024)7 benchmarks––22–247–
208Qwen2.5 32B Instructopen20.5 GB · 5 benchmarks––23––520.5 GB
209GPT 4o (Aug 06, 2024)8 benchmarks––22–198–
210Mistral Large Instruct 2411open74.6 GB · 6 benchmarks––22–22674.6 GB
211GPT 4o (Nov 20, 2024)10 benchmarks25–21172410–
212Mistral Large Instruct 2407open80.9 GB · 7 benchmarks––20–22780.9 GB
213Claude 3.5 Haiku (Oct 22, 2024)9 benchmarks29–2013–9–
214GPT 4 Turbo (Apr 09, 2024)8 benchmarks––21–238–
215Llama 3.3 70B Instructopen46.6 GB · 13 benchmarks22–1917211346.6 GB
216Mistral Small 3.1 24B Instruct 2503open15.1 GB · 7 benchmarks––211721715.1 GB
217Mistral Small 24B Instruct 2501open14.9 GB · 4 benchmarks––20––414.9 GB
218Claude 3 Opus (Feb 29, 2024)10 benchmarks––18–2210–
219Gemini 1.5 Pro 0015 benchmarks––19–205–
220Llama 3.1 70B Instructopen46.6 GB · 8 benchmarks––18–22846.6 GB
221Qwen2 72B Instructopen44.6 GB · 4 benchmarks–––––444.6 GB
222GPT 4o Mini (Jul 18, 2024)14 benchmarks18–22–1714–
223Llama 3.2 90B Vision Instructopen58.5 GB · 4 benchmarks––18––458.5 GB
224Gemma 3 12B ITopen8.0 GB · 8 benchmarks–––121588.0 GB
225Gemma 2 27B ITopen18.0 GB · 4 benchmarks––16––418.0 GB
226Meta Llama 3 70B Instructopen46.6 GB · 5 benchmarks––14––546.6 GB
227GPT 4 (Jun 13)9 benchmarks––14–239–
228Mistral Large 24024 benchmarks––15––4–
229Mixtral 8x22B Instruct v0.1open85.2 GB · 6 benchmarks––––19685.2 GB
230Gemini 1.5 Flash 0015 benchmarks––15–165–
231Claude 3 Sonnet (Feb 29, 2024)5 benchmarks––13––5–
232Gemma 2 9B ITopen6.1 GB · 4 benchmarks––14––46.1 GB
233Claude 2.15 benchmarks––––155–
234Qwen2.5 7B Instructopen5.0 GB · 6 benchmarks––––1565.0 GB
235Claude 2.04 benchmarks––12––4–
236Claude 3 Haiku (Mar 07, 2024)7 benchmarks––12–157–
237Llama 3.1 8B Instructopen5.3 GB · 11 benchmarks14–14716115.3 GB
238Gemma 3 4B ITopen2.8 GB · 6 benchmarks––––1662.8 GB
239Mistral Nemo Instruct 2407open8.1 GB · 5 benchmarks–––––58.1 GB
240Ministral 3B 24104 benchmarks––––164–

The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.

Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.

VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.

How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.