Best LLMs: open and proprietary
Open and proprietary models together on one 0–100 scale (overall capability). Switch to local models to see only what you can download and run.
40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built
| # | Model | llmrun Score | Coding | Agents | Math | Science | Reasoning | Benchmarks | VRAM |
|---|---|---|---|---|---|---|---|---|---|
| 121 | MiniMax M2.7open138 GB · 6 benchmarks | 41 | – | – | 35 | – | 6 | 138 GB | |
| 122 | GPT 5.5 Instant7 benchmarks | – | – | 45 | 36 | – | 7 | – | |
| 123 | Qwen3.5 Flash10 benchmarks | – | – | 47 | – | 43 | 10 | – | |
| 124 | Gemini 2.5 Pro Preview (Mar 25)6 benchmarks | – | – | – | – | 37 | 6 | – | |
| 125 | Gemma 4 31B ITopen20.4 GB · 11 benchmarks | 47 | – | – | 32 | 40 | 11 | 20.4 GB | |
| 126 | Qwen3.6 Flash10 benchmarks | – | – | 48 | – | 35 | 10 | – | |
| 127 | Qwen3.5 35B A3Bopen22.0 GB · 8 benchmarks | – | – | – | 34 | 37 | 8 | 22.0 GB | |
| 128 | Claude Haiku 4.5 (Oct 01, 2025)8 benchmarks | – | – | 44 | – | 40 | 8 | – | |
| 129 | Gemma 4 26B A4B ITopen16.1 GB · 9 benchmarks | 43 | – | – | 30 | 33 | 9 | 16.1 GB | |
| 130 | Mercury 24 benchmarks | 45 | – | – | 29 | – | 4 | – | |
| 131 | Claude Sonnet 4 (May 14, 2025)4 benchmarks | 43 | – | – | – | – | 4 | – | |
| 132 | Gemini 2.5 Pro Preview (May 06)5 benchmarks | – | – | – | 27 | – | 5 | – | |
| 133 | Qwen3 Max (Sep 23, 2025)13 benchmarks | – | – | 46 | – | 36 | 13 | – | |
| 134 | Claude 3.7 Sonnet (Feb 19, 2025)4 benchmarks | – | – | – | – | 41 | 4 | – | |
| 135 | O1 (Dec 17, 2024)8 benchmarks | – | – | 44 | – | 34 | 8 | – | |
| 136 | GPT 5.4 2026 03.056 benchmarks | 56 | – | – | – | 33 | 6 | – | |
| 137 | MiniMax M2open138 GB · 5 benchmarks | – | 31 | – | – | – | 5 | 138 GB | |
| 138 | DeepSeek R1 0528open415 GB · 11 benchmarks | 46 | – | 44 | – | 32 | 11 | 415 GB | |
| 139 | Qwen3.5 27Bopen17.4 GB · 6 benchmarks | 38 | – | – | – | 41 | 6 | 17.4 GB | |
| 140 | GLM 4.6open215 GB · 6 benchmarks | 36 | 31 | – | 29 | – | 6 | 215 GB | |
| 141 | Grok 3 Mini Beta5 benchmarks | 38 | – | 48 | – | – | 5 | – | |
| 142 | O3 Mini (Jan 31, 2025)18 benchmarks | 42 | – | 47 | 32 | 31 | 18 | – | |
| 143 | Gemini 2.5 Flash Preview (May 20)6 benchmarks | – | – | – | – | 36 | 6 | – | |
| 144 | Seed OSS 36B Instructopen22.3 GB · 4 benchmarks | – | – | – | – | – | 4 | 22.3 GB | |
| 145 | Kimi K2 Instruct 0905open620 GB · 6 benchmarks | 40 | – | – | – | – | 6 | 620 GB | |
| 146 | Mistral Medium 26049 benchmarks | 41 | – | – | 30 | 33 | 9 | – | |
| 147 | GPT 5 Nano (Aug 07, 2025)15 benchmarks | 42 | – | 48 | – | 25 | 15 | – | |
| 148 | GLM 4.5open216 GB · 7 benchmarks | 38 | 32 | – | – | – | 7 | 216 GB | |
| 149 | Qwen3 30B A3B Thinking 2507open18.7 GB · 8 benchmarks | – | – | – | 28 | 27 | 8 | 18.7 GB | |
| 150 | GPT 5.2 2025 12.116 benchmarks | – | – | – | – | 28 | 6 | – | |
| 151 | Kimi K2 Instructopen620 GB · 10 benchmarks | 41 | 28 | – | – | 25 | 10 | 620 GB | |
| 152 | Gemini 2.5 Flash9 benchmarks | – | 22 | – | – | 34 | 9 | – | |
| 153 | DeepSeek V3.1open415 GB · 7 benchmarks | – | – | – | – | 36 | 7 | 415 GB | |
| 154 | Gemini 2.5 Flash Preview (Apr 17)5 benchmarks | – | – | – | – | – | 5 | – | |
| 155 | Qwen3.5 9Bopen6.4 GB · 9 benchmarks | – | – | – | 32 | 30 | 9 | 6.4 GB | |
| 156 | DeepSeek R1open415 GB · 14 benchmarks | 39 | – | 40 | 28 | 29 | 14 | 415 GB | |
| 157 | DeepSeek Chat6 benchmarks | – | – | – | – | 23 | 6 | – | |
| 158 | Qwen3 235B A22B Instruct 2507open142 GB · 8 benchmarks | 41 | – | – | – | 31 | 8 | 142 GB | |
| 159 | Qwen3 32Bopen20.3 GB · 9 benchmarks | 33 | – | – | 26 | 26 | 9 | 20.3 GB | |
| 160 | Grok 3 Beta6 benchmarks | – | – | 40 | – | – | 6 | – | |
| 161 | Qwen3 235B A22Bopen142 GB · 10 benchmarks | 41 | – | – | – | 31 | 10 | 142 GB | |
| 162 | Qwen3 14Bopen9.5 GB · 8 benchmarks | – | – | – | 25 | 24 | 8 | 9.5 GB | |
| 163 | GPT OSS 120Bopen70.5 GB · 20 benchmarks | 37 | 14 | – | 31 | 30 | 20 | 70.5 GB | |
| 164 | DeepSeek R1 Distill Qwen 32Bopen20.5 GB · 4 benchmarks | – | – | – | – | – | 4 | 20.5 GB | |
| 165 | Qwen3 30B A3B Instruct 2507open18.7 GB · 5 benchmarks | – | – | – | – | 26 | 5 | 18.7 GB | |
| 166 | GLM 4.5 Airopen66.7 GB · 4 benchmarks | – | – | – | – | – | 4 | 66.7 GB | |
| 167 | GPT OSS 20Bopen12.9 GB · 11 benchmarks | 40 | – | – | 24 | 26 | 11 | 12.9 GB | |
| 168 | QwQ 32Bopen20.5 GB · 6 benchmarks | – | – | – | – | – | 6 | 20.5 GB | |
| 169 | NVIDIA Nemotron 3 Super 120B A12B BF16open74.7 GB · 4 benchmarks | 36 | – | – | 27 | – | 4 | 74.7 GB | |
| 170 | GPT 4.1 (Apr 14, 2025)17 benchmarks | 39 | – | 34 | 26 | 26 | 17 | – | |
| 171 | GPT 4.5 Preview (Feb 27, 2025)11 benchmarks | 36 | – | 33 | 27 | 28 | 11 | – | |
| 172 | Qwen3 30B A3Bopen18.7 GB · 7 benchmarks | – | – | – | – | 22 | 7 | 18.7 GB | |
| 173 | Qwen3 8Bopen5.5 GB · 8 benchmarks | – | – | – | 21 | 21 | 8 | 5.5 GB | |
| 174 | Grok 34 benchmarks | – | – | – | – | 26 | 4 | – | |
| 175 | GPT 5.4 Nano 2026 03.176 benchmarks | – | – | 36 | – | 27 | 6 | – | |
| 176 | O1 Mini (Sep 12, 2024)6 benchmarks | – | – | 36 | – | 22 | 6 | – | |
| 177 | DeepSeek v3 0324open415 GB · 13 benchmarks | 39 | – | 33 | 27 | 24 | 13 | 415 GB | |
| 178 | GPT 5.1 2025 11.137 benchmarks | – | – | – | 26 | 27 | 7 | – | |
| 179 | DeepSeek R1 Distill Qwen 14Bopen9.6 GB · 4 benchmarks | – | – | 38 | – | – | 4 | 9.6 GB | |
| 180 | GPT 4.1 Mini (Apr 14, 2025)16 benchmarks | 32 | – | 36 | 27 | 26 | 16 | – | |
| 181 | Gemini 2.0 Flash Thinking Exp (Jan 21)6 benchmarks | – | – | – | 22 | – | 6 | – | |
| 182 | Gemini 2.0 Flash 0017 benchmarks | – | – | 32 | – | 24 | 7 | – | |
| 183 | Mistral Medium 25086 benchmarks | 33 | – | – | 24 | 26 | 6 | – | |
| 184 | O1 Preview (Sep 12, 2024)6 benchmarks | – | – | 32 | – | 31 | 6 | – | |
| 185 | Gemini 2.0 Pro Exp (Feb 05)4 benchmarks | – | – | – | – | – | 4 | – | |
| 186 | GPT 5.4 Mini 2026 03.176 benchmarks | – | – | 30 | – | 29 | 6 | – | |
| 187 | Mistral Medium 25055 benchmarks | – | – | 33 | 23 | – | 5 | – | |
| 188 | Gemini 2.5 Flash Lite Preview Thinking (Jun 17)5 benchmarks | 35 | – | – | – | 24 | 5 | – | |
| 189 | Mistral Large 3 675B Instruct 2512open446 GB · 5 benchmarks | 33 | – | – | 26 | 25 | 5 | 446 GB | |
| 190 | Magistral Small 2506open14.9 GB · 4 benchmarks | – | – | – | – | 24 | 4 | 14.9 GB | |
| 191 | Claude 3.5 Sonnet (Oct 22, 2024)11 benchmarks | 38 | 26 | 23 | 21 | 29 | 11 | – | |
| 192 | DeepSeek v3open415 GB · 10 benchmarks | 37 | – | 26 | 22 | 21 | 10 | 415 GB | |
| 193 | Llama 4 Maverick 17B 128E Instructopen265 GB · 17 benchmarks | 25 | – | 29 | 26 | 23 | 17 | 265 GB | |
| 194 | Qwen Max (Jan 25, 2025)5 benchmarks | – | – | 27 | – | – | 5 | – | |
| 195 | Gemini 1.5 Pro 0029 benchmarks | – | – | 28 | 22 | 21 | 9 | – | |
| 196 | Magistral Small 2509open15.1 GB · 6 benchmarks | – | – | – | 18 | 22 | 6 | 15.1 GB | |
| 197 | Mistral Small 3.2 24B Instruct 2506open15.1 GB · 6 benchmarks | – | – | – | 18 | 22 | 6 | 15.1 GB | |
| 198 | Phi 4open9.5 GB · 6 benchmarks | – | – | 26 | – | – | 6 | 9.5 GB | |
| 199 | Grok 2 (Dec 12)6 benchmarks | – | – | 25 | – | 24 | 6 | – | |
| 200 | Claude 3.5 Sonnet (Jun 20, 2024)7 benchmarks | – | – | 22 | – | 26 | 7 | – | |
| 201 | Qwen2.5 72B Instructopen44.6 GB · 9 benchmarks | – | – | 25 | – | 23 | 9 | 44.6 GB | |
| 202 | Gemma 3 27B ITopen18.1 GB · 11 benchmarks | 18 | – | 29 | 16 | 17 | 11 | 18.1 GB | |
| 203 | Llama 4 Scout 17B 16E Instructopen71.7 GB · 12 benchmarks | – | – | 24 | 18 | 20 | 12 | 71.7 GB | |
| 204 | Gemini 1.5 Flash 0026 benchmarks | – | – | 25 | – | – | 6 | – | |
| 205 | GPT 4.1 Nano (Apr 14, 2025)13 benchmarks | 21 | – | 30 | 17 | 17 | 13 | – | |
| 206 | Llama 3.1 405B Instructopen268 GB · 8 benchmarks | – | – | 22 | – | 22 | 8 | 268 GB | |
| 207 | GPT 4o (May 13, 2024)7 benchmarks | – | – | 22 | – | 24 | 7 | – | |
| 208 | Qwen2.5 32B Instructopen20.5 GB · 5 benchmarks | – | – | 23 | – | – | 5 | 20.5 GB | |
| 209 | GPT 4o (Aug 06, 2024)8 benchmarks | – | – | 22 | – | 19 | 8 | – | |
| 210 | Mistral Large Instruct 2411open74.6 GB · 6 benchmarks | – | – | 22 | – | 22 | 6 | 74.6 GB | |
| 211 | GPT 4o (Nov 20, 2024)10 benchmarks | 25 | – | 21 | 17 | 24 | 10 | – | |
| 212 | Mistral Large Instruct 2407open80.9 GB · 7 benchmarks | – | – | 20 | – | 22 | 7 | 80.9 GB | |
| 213 | Claude 3.5 Haiku (Oct 22, 2024)9 benchmarks | 29 | – | 20 | 13 | – | 9 | – | |
| 214 | GPT 4 Turbo (Apr 09, 2024)8 benchmarks | – | – | 21 | – | 23 | 8 | – | |
| 215 | Llama 3.3 70B Instructopen46.6 GB · 13 benchmarks | 22 | – | 19 | 17 | 21 | 13 | 46.6 GB | |
| 216 | Mistral Small 3.1 24B Instruct 2503open15.1 GB · 7 benchmarks | – | – | 21 | 17 | 21 | 7 | 15.1 GB | |
| 217 | Mistral Small 24B Instruct 2501open14.9 GB · 4 benchmarks | – | – | 20 | – | – | 4 | 14.9 GB | |
| 218 | Claude 3 Opus (Feb 29, 2024)10 benchmarks | – | – | 18 | – | 22 | 10 | – | |
| 219 | Gemini 1.5 Pro 0015 benchmarks | – | – | 19 | – | 20 | 5 | – | |
| 220 | Llama 3.1 70B Instructopen46.6 GB · 8 benchmarks | – | – | 18 | – | 22 | 8 | 46.6 GB | |
| 221 | Qwen2 72B Instructopen44.6 GB · 4 benchmarks | – | – | – | – | – | 4 | 44.6 GB | |
| 222 | GPT 4o Mini (Jul 18, 2024)14 benchmarks | 18 | – | 22 | – | 17 | 14 | – | |
| 223 | Llama 3.2 90B Vision Instructopen58.5 GB · 4 benchmarks | – | – | 18 | – | – | 4 | 58.5 GB | |
| 224 | Gemma 3 12B ITopen8.0 GB · 8 benchmarks | – | – | – | 12 | 15 | 8 | 8.0 GB | |
| 225 | Gemma 2 27B ITopen18.0 GB · 4 benchmarks | – | – | 16 | – | – | 4 | 18.0 GB | |
| 226 | Meta Llama 3 70B Instructopen46.6 GB · 5 benchmarks | – | – | 14 | – | – | 5 | 46.6 GB | |
| 227 | GPT 4 (Jun 13)9 benchmarks | – | – | 14 | – | 23 | 9 | – | |
| 228 | Mistral Large 24024 benchmarks | – | – | 15 | – | – | 4 | – | |
| 229 | Mixtral 8x22B Instruct v0.1open85.2 GB · 6 benchmarks | – | – | – | – | 19 | 6 | 85.2 GB | |
| 230 | Gemini 1.5 Flash 0015 benchmarks | – | – | 15 | – | 16 | 5 | – | |
| 231 | Claude 3 Sonnet (Feb 29, 2024)5 benchmarks | – | – | 13 | – | – | 5 | – | |
| 232 | Gemma 2 9B ITopen6.1 GB · 4 benchmarks | – | – | 14 | – | – | 4 | 6.1 GB | |
| 233 | Claude 2.15 benchmarks | – | – | – | – | 15 | 5 | – | |
| 234 | Qwen2.5 7B Instructopen5.0 GB · 6 benchmarks | – | – | – | – | 15 | 6 | 5.0 GB | |
| 235 | Claude 2.04 benchmarks | – | – | 12 | – | – | 4 | – | |
| 236 | Claude 3 Haiku (Mar 07, 2024)7 benchmarks | – | – | 12 | – | 15 | 7 | – | |
| 237 | Llama 3.1 8B Instructopen5.3 GB · 11 benchmarks | 14 | – | 14 | 7 | 16 | 11 | 5.3 GB | |
| 238 | Gemma 3 4B ITopen2.8 GB · 6 benchmarks | – | – | – | – | 16 | 6 | 2.8 GB | |
| 239 | Mistral Nemo Instruct 2407open8.1 GB · 5 benchmarks | – | – | – | – | – | 5 | 8.1 GB | |
| 240 | Ministral 3B 24104 benchmarks | – | – | – | – | 16 | 4 | – |
The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.
Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.
VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.
How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.