Best LLMs for math: open and proprietary
Open and proprietary models together on one 0–100 scale (mathematics). Switch to local models to see only what you can download and run.
40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built
| # | Model | llmrun Score | Coding | Agents | Math | Science | Reasoning | Benchmarks | VRAM |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT 6.1 Sol Max13 benchmarks | 64 | – | 96 | 56 | 83 | 13 | – | |
| 2 | GPT 6 Astra Max19 benchmarks | 83 | 72 | 96 | 57 | 86 | 19 | – | |
| 3 | Claude Opus 5.5 Max17 benchmarks | 78 | – | 96 | 58 | 82 | 17 | – | |
| 4 | Claude Fable 5.1 Max15 benchmarks | 79 | – | 95 | 57 | 75 | 15 | – | |
| 5 | Claude Fable 5 Max20 benchmarks | 78 | 62 | 94 | 54 | 74 | 20 | – | |
| 6 | GPT 6 Sol Max18 benchmarks | 79 | – | 94 | 56 | 75 | 18 | – | |
| 7 | Claude Sonnet 5.5 Max13 benchmarks | 75 | – | 93 | 58 | 81 | 13 | – | |
| 8 | Claude Opus 5 Max22 benchmarks | 78 | 72 | 91 | 55 | 75 | 22 | – | |
| 9 | GPT 5.6 Sol Max21 benchmarks | 78 | 70 | 91 | 57 | 77 | 21 | – | |
| 10 | GPT 5.5 Pro7 benchmarks | – | – | 90 | – | 70 | 7 | – | |
| 11 | GPT 5.6 Terra Max20 benchmarks | 73 | 67 | 87 | 55 | 71 | 20 | – | |
| 12 | GPT 5.4 Pro (Mar 05, 2026)8 benchmarks | – | – | 83 | 56 | 74 | 8 | – | |
| 13 | Claude Opus 4.8 Max19 benchmarks | 64 | 55 | 82 | 48 | 66 | 19 | – | |
| 14 | GPT 5.6 Luna Max20 benchmarks | 69 | 63 | 82 | 48 | 62 | 20 | – | |
| 15 | GPT 6 Luna Max18 benchmarks | 69 | – | 82 | 47 | 60 | 18 | – | |
| 16 | Kimi K3open1674 GB · 26 benchmarks | 73 | 61 | 81 | 52 | 63 | 26 | 1674 GB | |
| 17 | GPT 5.4 (Mar 05, 2026)20 benchmarks | 69 | 57 | 78 | 51 | 67 | 20 | – | |
| 18 | Qwen3.8 Max10 benchmarks | – | – | 78 | – | 62 | 10 | – | |
| 19 | Muse Spark 1.3 Max6 benchmarks | – | – | 78 | 54 | 61 | 6 | – | |
| 20 | GPT 5.2 Pro (Dec 11, 2025)3 benchmarks | — | – | – | 77 | – | – | 3 | – |
| 21 | Claude Sonnet 5 Max13 benchmarks | – | – | 77 | 38 | 57 | 13 | – | |
| 22 | Muse Spark 1.36 benchmarks | – | – | 76 | – | 53 | 6 | – | |
| 23 | DeepSeek V4.1 Flashopen458 GB · 10 benchmarks | 54 | – | 76 | 45 | 57 | 10 | 458 GB | |
| 24 | Gemini 3.7 Flash15 benchmarks | 56 | – | 74 | 48 | 70 | 15 | – | |
| 25 | Claude Opus 4.7 Max15 benchmarks | 67 | – | 73 | 42 | 64 | 15 | – | |
| 26 | GLM 5.3open456 GB · 21 benchmarks | 67 | 68 | 72 | 49 | 58 | 21 | 456 GB | |
| 27 | Qwen3.8 Max (Sep 02)6 benchmarks | – | – | 72 | – | – | 6 | – | |
| 28 | DeepSeek V4 Pro 0813open991 GB · 21 benchmarks | 63 | – | 71 | 46 | 65 | 21 | 991 GB | |
| 29 | Claude Opus 4.6 Max12 benchmarks | – | – | 71 | 45 | 55 | 12 | – | |
| 30 | DeepSeek V4 Flash 0731open183 GB · 21 benchmarks | 59 | – | 71 | 45 | 62 | 21 | 183 GB | |
| 31 | Claude Sonnet 4.6 Max11 benchmarks | – | – | 70 | 34 | 59 | 11 | – | |
| 32 | Muse Spark 1.19 benchmarks | 66 | 59 | 69 | 48 | – | 9 | – | |
| 33 | GLM 5.2open456 GB · 24 benchmarks | 58 | 60 | 68 | 47 | 52 | 24 | 456 GB | |
| 34 | Qwen3.7 Max17 benchmarks | 59 | – | 68 | 43 | 58 | 17 | – | |
| 35 | Grok 4.516 benchmarks | 65 | – | 66 | 47 | 60 | 16 | – | |
| 36 | Gemini 3.6 Flash16 benchmarks | 52 | – | 66 | 45 | 63 | 16 | – | |
| 37 | GPT 5.2 (Dec 11, 2025)12 benchmarks | – | – | 65 | – | 61 | 12 | – | |
| 38 | GPT 5 Pro (Oct 06, 2025)5 benchmarks | – | – | 64 | – | 51 | 5 | – | |
| 39 | Grok 4.79 benchmarks | – | – | 63 | 49 | 63 | 9 | – | |
| 40 | Kimi K2.6open620 GB · 18 benchmarks | 57 | – | 63 | 43 | 51 | 18 | 620 GB | |
| 41 | GPT 5 (Aug 07, 2025)20 benchmarks | 58 | – | 62 | 40 | 48 | 20 | – | |
| 42 | GLM 5.3 Flashopen195 GB · 17 benchmarks | 52 | 63 | 62 | 44 | 37 | 17 | 195 GB | |
| 43 | Kimi K2.7 Codeopen620 GB · 19 benchmarks | 53 | 46 | 61 | 40 | 50 | 19 | 620 GB | |
| 44 | GPT 5.4 Mini (Mar 17, 2026)12 benchmarks | – | – | 60 | 40 | 47 | 12 | – | |
| 45 | Gemini 3 Pro Preview17 benchmarks | 62 | 55 | 60 | 46 | 54 | 17 | – | |
| 46 | Grok 4.20 0309 Reasoning8 benchmarks | – | – | 58 | – | 49 | 8 | – | |
| 47 | Muse Spark6 benchmarks | – | – | 58 | 47 | – | 6 | – | |
| 48 | DeepSeek V4 Proopen960 GB · 22 benchmarks | 49 | – | 57 | 44 | 49 | 22 | 960 GB | |
| 49 | Qwen3.8 27Bopen17.4 GB · 9 benchmarks | 51 | – | 57 | 37 | 50 | 9 | 17.4 GB | |
| 50 | GLM 5.1open457 GB · 13 benchmarks | 53 | 54 | 57 | 40 | 46 | 13 | 457 GB | |
| 51 | Grok 4.311 benchmarks | – | – | 57 | 41 | 52 | 11 | – | |
| 52 | Inkling Smallopen160 GB · 12 benchmarks | – | – | 57 | 41 | 54 | 12 | 160 GB | |
| 53 | GPT 5 Mini (Aug 07, 2025)15 benchmarks | 50 | – | 57 | – | 42 | 15 | – | |
| 54 | Qwen3.6 Plus15 benchmarks | 47 | – | 55 | 38 | 41 | 15 | – | |
| 55 | Qwen3.6 27Bopen17.4 GB · 12 benchmarks | 42 | – | 53 | 36 | 37 | 12 | 17.4 GB | |
| 56 | Qwen3.5 397B A17Bopen266 GB · 9 benchmarks | – | – | 52 | – | 46 | 9 | 266 GB | |
| 57 | O4 Mini (Apr 16, 2025)19 benchmarks | 49 | – | 52 | 34 | 42 | 19 | – | |
| 58 | Inklingopen572 GB · 21 benchmarks | 43 | – | 52 | 40 | 53 | 21 | 572 GB | |
| 59 | NVIDIA Nemotron 3 Ultra 550B A55B BF16open370 GB · 14 benchmarks | 43 | – | 52 | 37 | 46 | 14 | 370 GB | |
| 60 | O3 (Apr 16, 2025)19 benchmarks | 52 | – | 52 | 35 | 46 | 19 | – | |
| 61 | GLM 4.7open216 GB · 13 benchmarks | 41 | 32 | 51 | 36 | 35 | 13 | 216 GB | |
| 62 | Gemini 2.5 Pro13 benchmarks | – | 29 | 49 | 37 | 43 | 13 | – | |
| 63 | Gemini 3.1 Flash Lite6 benchmarks | – | – | 49 | – | 38 | 6 | – | |
| 64 | Qwen3.6 35B A3Bopen22.0 GB · 12 benchmarks | 44 | – | 49 | 35 | 38 | 12 | 22.0 GB | |
| 65 | Qwen3.7 Flash5 benchmarks | – | – | 49 | – | 46 | 5 | – | |
| 66 | GPT 5 Nano (Aug 07, 2025)15 benchmarks | 42 | – | 48 | – | 25 | 15 | – | |
| 67 | Qwen3.6 Flash10 benchmarks | – | – | 48 | – | 35 | 10 | – | |
| 68 | Grok 3 Mini Beta5 benchmarks | 38 | – | 48 | – | – | 5 | – | |
| 69 | Qwen3.5 Flash10 benchmarks | – | – | 47 | – | 43 | 10 | – | |
| 70 | O3 Mini (Jan 31, 2025)18 benchmarks | 42 | – | 47 | 32 | 31 | 18 | – | |
| 71 | MiniMax M3open257 GB · 19 benchmarks | 52 | 40 | 46 | 41 | 38 | 19 | 257 GB | |
| 72 | Gemini 3.5 Flash Lite11 benchmarks | 43 | – | 46 | – | 43 | 11 | – | |
| 73 | Qwen3 Max (Sep 23, 2025)13 benchmarks | – | – | 46 | – | 36 | 13 | – | |
| 74 | GPT 5.5 Instant7 benchmarks | – | – | 45 | 36 | – | 7 | – | |
| 75 | O1 (Dec 17, 2024)8 benchmarks | – | – | 44 | – | 34 | 8 | – | |
| 76 | Claude Haiku 4.5 (Oct 01, 2025)8 benchmarks | – | – | 44 | – | 40 | 8 | – | |
| 77 | DeepSeek R1 0528open415 GB · 11 benchmarks | 46 | – | 44 | – | 32 | 11 | 415 GB | |
| 78 | Grok 3 Beta6 benchmarks | – | – | 40 | – | – | 6 | – | |
| 79 | DeepSeek R1open415 GB · 14 benchmarks | 39 | – | 40 | 28 | 29 | 14 | 415 GB | |
| 80 | DeepSeek R1 Distill Llama 70Bopen43.3 GB · 3 benchmarks | — | – | – | 39 | – | – | 3 | 43.3 GB |
| 81 | DeepSeek R1 Distill Qwen 14Bopen9.6 GB · 4 benchmarks | – | – | 38 | – | – | 4 | 9.6 GB | |
| 82 | GPT 4.1 Mini (Apr 14, 2025)16 benchmarks | 32 | – | 36 | 27 | 26 | 16 | – | |
| 83 | GPT 5.4 Nano 2026 03.176 benchmarks | – | – | 36 | – | 27 | 6 | – | |
| 84 | O1 Mini (Sep 12, 2024)6 benchmarks | – | – | 36 | – | 22 | 6 | – | |
| 85 | GPT 4.1 (Apr 14, 2025)17 benchmarks | 39 | – | 34 | 26 | 26 | 17 | – | |
| 86 | GPT 4.5 Preview (Feb 27, 2025)11 benchmarks | 36 | – | 33 | 27 | 28 | 11 | – | |
| 87 | DeepSeek v3 0324open415 GB · 13 benchmarks | 39 | – | 33 | 27 | 24 | 13 | 415 GB | |
| 88 | Mistral Medium 25055 benchmarks | – | – | 33 | 23 | – | 5 | – | |
| 89 | Gemini 2.0 Flash 0017 benchmarks | – | – | 32 | – | 24 | 7 | – | |
| 90 | O1 Preview (Sep 12, 2024)6 benchmarks | – | – | 32 | – | 31 | 6 | – | |
| 91 | GPT 5.4 Mini 2026 03.176 benchmarks | – | – | 30 | – | 29 | 6 | – | |
| 92 | GPT 4.1 Nano (Apr 14, 2025)13 benchmarks | 21 | – | 30 | 17 | 17 | 13 | – | |
| 93 | Gemma 3 27B ITopen18.1 GB · 11 benchmarks | 18 | – | 29 | 16 | 17 | 11 | 18.1 GB | |
| 94 | Llama 4 Maverick 17B 128E Instructopen265 GB · 17 benchmarks | 25 | – | 29 | 26 | 23 | 17 | 265 GB | |
| 95 | Gemini 1.5 Pro 0029 benchmarks | – | – | 28 | 22 | 21 | 9 | – | |
| 96 | Qwen Max (Jan 25, 2025)5 benchmarks | – | – | 27 | – | – | 5 | – | |
| 97 | Qwen Plus (Jan 25, 2025)3 benchmarks | — | – | – | 26 | – | – | 3 | – |
| 98 | DeepSeek v3open415 GB · 10 benchmarks | 37 | – | 26 | 22 | 21 | 10 | 415 GB | |
| 99 | Phi 4open9.5 GB · 6 benchmarks | – | – | 26 | – | – | 6 | 9.5 GB | |
| 100 | Gemini 1.5 Flash 0026 benchmarks | – | – | 25 | – | – | 6 | – | |
| 101 | Grok 2 (Dec 12)6 benchmarks | – | – | 25 | – | 24 | 6 | – | |
| 102 | Qwen2.5 72B Instructopen44.6 GB · 9 benchmarks | – | – | 25 | – | 23 | 9 | 44.6 GB | |
| 103 | Llama 4 Scout 17B 16E Instructopen71.7 GB · 12 benchmarks | – | – | 24 | 18 | 20 | 12 | 71.7 GB | |
| 104 | Claude 3.5 Sonnet (Oct 22, 2024)11 benchmarks | 38 | 26 | 23 | 21 | 29 | 11 | – | |
| 105 | Qwen2.5 32B Instructopen20.5 GB · 5 benchmarks | – | – | 23 | – | – | 5 | 20.5 GB | |
| 106 | Qwen Turbo (Nov 01, 2024)3 benchmarks | — | – | – | 23 | – | – | 3 | – |
| 107 | GPT 4o (Aug 06, 2024)8 benchmarks | – | – | 22 | – | 19 | 8 | – | |
| 108 | GPT 4o Mini (Jul 18, 2024)14 benchmarks | 18 | – | 22 | – | 17 | 14 | – | |
| 109 | Claude 3.5 Sonnet (Jun 20, 2024)7 benchmarks | – | – | 22 | – | 26 | 7 | – | |
| 110 | Llama 3.1 405B Instructopen268 GB · 8 benchmarks | – | – | 22 | – | 22 | 8 | 268 GB | |
| 111 | GPT 4o (May 13, 2024)7 benchmarks | – | – | 22 | – | 24 | 7 | – | |
| 112 | Mistral Large Instruct 2411open74.6 GB · 6 benchmarks | – | – | 22 | – | 22 | 6 | 74.6 GB | |
| 113 | GPT 4o (Nov 20, 2024)10 benchmarks | 25 | – | 21 | 17 | 24 | 10 | – | |
| 114 | GPT 4 Turbo (Apr 09, 2024)8 benchmarks | – | – | 21 | – | 23 | 8 | – | |
| 115 | Mistral Small 3.1 24B Instruct 2503open15.1 GB · 7 benchmarks | – | – | 21 | 17 | 21 | 7 | 15.1 GB | |
| 116 | Mistral Large Instruct 2407open80.9 GB · 7 benchmarks | – | – | 20 | – | 22 | 7 | 80.9 GB | |
| 117 | Claude 3.5 Haiku (Oct 22, 2024)9 benchmarks | 29 | – | 20 | 13 | – | 9 | – | |
| 118 | Mistral Small 24B Instruct 2501open14.9 GB · 4 benchmarks | – | – | 20 | – | – | 4 | 14.9 GB | |
| 119 | Llama 3.1 Tulu 3 70B DPOopen43.3 GB · 3 benchmarks | — | – | – | 19 | – | – | 3 | 43.3 GB |
| 120 | Llama 3.3 70B Instructopen46.6 GB · 13 benchmarks | 22 | – | 19 | 17 | 21 | 13 | 46.6 GB |
The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.
Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.
VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.
How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.