Best LLMs for math: open and proprietary

Open and proprietary models together on one 0–100 scale (mathematics). Switch to local models to see only what you can download and run.

40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built

Models ranked by math llmrun Score
#Modelllmrun ScoreCodingAgentsMathScienceReasoningBenchmarksVRAM
1GPT 6.1 Sol Max13 benchmarks64–96568313–
2GPT 6 Astra Max19 benchmarks837296578619–
3Claude Opus 5.5 Max17 benchmarks78–96588217–
4Claude Fable 5.1 Max15 benchmarks79–95577515–
5Claude Fable 5 Max20 benchmarks786294547420–
6GPT 6 Sol Max18 benchmarks79–94567518–
7Claude Sonnet 5.5 Max13 benchmarks75–93588113–
8Claude Opus 5 Max22 benchmarks787291557522–
9GPT 5.6 Sol Max21 benchmarks787091577721–
10GPT 5.5 Pro7 benchmarks––90–707–
11GPT 5.6 Terra Max20 benchmarks736787557120–
12GPT 5.4 Pro (Mar 05, 2026)8 benchmarks––8356748–
13Claude Opus 4.8 Max19 benchmarks645582486619–
14GPT 5.6 Luna Max20 benchmarks696382486220–
15GPT 6 Luna Max18 benchmarks69–82476018–
16Kimi K3open1674 GB · 26 benchmarks7361815263261674 GB
17GPT 5.4 (Mar 05, 2026)20 benchmarks695778516720–
18Qwen3.8 Max10 benchmarks––78–6210–
19Muse Spark 1.3 Max6 benchmarks––7854616–
20GPT 5.2 Pro (Dec 11, 2025)3 benchmarks—––77––3–
21Claude Sonnet 5 Max13 benchmarks––77385713–
22Muse Spark 1.36 benchmarks––76–536–
23DeepSeek V4.1 Flashopen458 GB · 10 benchmarks54–76455710458 GB
24Gemini 3.7 Flash15 benchmarks56–74487015–
25Claude Opus 4.7 Max15 benchmarks67–73426415–
26GLM 5.3open456 GB · 21 benchmarks676872495821456 GB
27Qwen3.8 Max (Sep 02)6 benchmarks––72––6–
28DeepSeek V4 Pro 0813open991 GB · 21 benchmarks63–71466521991 GB
29Claude Opus 4.6 Max12 benchmarks––71455512–
30DeepSeek V4 Flash 0731open183 GB · 21 benchmarks59–71456221183 GB
31Claude Sonnet 4.6 Max11 benchmarks––70345911–
32Muse Spark 1.19 benchmarks66596948–9–
33GLM 5.2open456 GB · 24 benchmarks586068475224456 GB
34Qwen3.7 Max17 benchmarks59–68435817–
35Grok 4.516 benchmarks65–66476016–
36Gemini 3.6 Flash16 benchmarks52–66456316–
37GPT 5.2 (Dec 11, 2025)12 benchmarks––65–6112–
38GPT 5 Pro (Oct 06, 2025)5 benchmarks––64–515–
39Grok 4.79 benchmarks––6349639–
40Kimi K2.6open620 GB · 18 benchmarks57–63435118620 GB
41GPT 5 (Aug 07, 2025)20 benchmarks58–62404820–
42GLM 5.3 Flashopen195 GB · 17 benchmarks526362443717195 GB
43Kimi K2.7 Codeopen620 GB · 19 benchmarks534661405019620 GB
44GPT 5.4 Mini (Mar 17, 2026)12 benchmarks––60404712–
45Gemini 3 Pro Preview17 benchmarks625560465417–
46Grok 4.20 0309 Reasoning8 benchmarks––58–498–
47Muse Spark6 benchmarks––5847–6–
48DeepSeek V4 Proopen960 GB · 22 benchmarks49–57444922960 GB
49Qwen3.8 27Bopen17.4 GB · 9 benchmarks51–573750917.4 GB
50GLM 5.1open457 GB · 13 benchmarks535457404613457 GB
51Grok 4.311 benchmarks––57415211–
52Inkling Smallopen160 GB · 12 benchmarks––57415412160 GB
53GPT 5 Mini (Aug 07, 2025)15 benchmarks50–57–4215–
54Qwen3.6 Plus15 benchmarks47–55384115–
55Qwen3.6 27Bopen17.4 GB · 12 benchmarks42–5336371217.4 GB
56Qwen3.5 397B A17Bopen266 GB · 9 benchmarks––52–469266 GB
57O4 Mini (Apr 16, 2025)19 benchmarks49–52344219–
58Inklingopen572 GB · 21 benchmarks43–52405321572 GB
59NVIDIA Nemotron 3 Ultra 550B A55B BF16open370 GB · 14 benchmarks43–52374614370 GB
60O3 (Apr 16, 2025)19 benchmarks52–52354619–
61GLM 4.7open216 GB · 13 benchmarks413251363513216 GB
62Gemini 2.5 Pro13 benchmarks–2949374313–
63Gemini 3.1 Flash Lite6 benchmarks––49–386–
64Qwen3.6 35B A3Bopen22.0 GB · 12 benchmarks44–4935381222.0 GB
65Qwen3.7 Flash5 benchmarks––49–465–
66GPT 5 Nano (Aug 07, 2025)15 benchmarks42–48–2515–
67Qwen3.6 Flash10 benchmarks––48–3510–
68Grok 3 Mini Beta5 benchmarks38–48––5–
69Qwen3.5 Flash10 benchmarks––47–4310–
70O3 Mini (Jan 31, 2025)18 benchmarks42–47323118–
71MiniMax M3open257 GB · 19 benchmarks524046413819257 GB
72Gemini 3.5 Flash Lite11 benchmarks43–46–4311–
73Qwen3 Max (Sep 23, 2025)13 benchmarks––46–3613–
74GPT 5.5 Instant7 benchmarks––4536–7–
75O1 (Dec 17, 2024)8 benchmarks––44–348–
76Claude Haiku 4.5 (Oct 01, 2025)8 benchmarks––44–408–
77DeepSeek R1 0528open415 GB · 11 benchmarks46–44–3211415 GB
78Grok 3 Beta6 benchmarks––40––6–
79DeepSeek R1open415 GB · 14 benchmarks39–40282914415 GB
80DeepSeek R1 Distill Llama 70Bopen43.3 GB · 3 benchmarks—––39––343.3 GB
81DeepSeek R1 Distill Qwen 14Bopen9.6 GB · 4 benchmarks––38––49.6 GB
82GPT 4.1 Mini (Apr 14, 2025)16 benchmarks32–36272616–
83GPT 5.4 Nano 2026 03.176 benchmarks––36–276–
84O1 Mini (Sep 12, 2024)6 benchmarks––36–226–
85GPT 4.1 (Apr 14, 2025)17 benchmarks39–34262617–
86GPT 4.5 Preview (Feb 27, 2025)11 benchmarks36–33272811–
87DeepSeek v3 0324open415 GB · 13 benchmarks39–33272413415 GB
88Mistral Medium 25055 benchmarks––3323–5–
89Gemini 2.0 Flash 0017 benchmarks––32–247–
90O1 Preview (Sep 12, 2024)6 benchmarks––32–316–
91GPT 5.4 Mini 2026 03.176 benchmarks––30–296–
92GPT 4.1 Nano (Apr 14, 2025)13 benchmarks21–30171713–
93Gemma 3 27B ITopen18.1 GB · 11 benchmarks18–2916171118.1 GB
94Llama 4 Maverick 17B 128E Instructopen265 GB · 17 benchmarks25–29262317265 GB
95Gemini 1.5 Pro 0029 benchmarks––2822219–
96Qwen Max (Jan 25, 2025)5 benchmarks––27––5–
97Qwen Plus (Jan 25, 2025)3 benchmarks—––26––3–
98DeepSeek v3open415 GB · 10 benchmarks37–26222110415 GB
99Phi 4open9.5 GB · 6 benchmarks––26––69.5 GB
100Gemini 1.5 Flash 0026 benchmarks––25––6–
101Grok 2 (Dec 12)6 benchmarks––25–246–
102Qwen2.5 72B Instructopen44.6 GB · 9 benchmarks––25–23944.6 GB
103Llama 4 Scout 17B 16E Instructopen71.7 GB · 12 benchmarks––2418201271.7 GB
104Claude 3.5 Sonnet (Oct 22, 2024)11 benchmarks382623212911–
105Qwen2.5 32B Instructopen20.5 GB · 5 benchmarks––23––520.5 GB
106Qwen Turbo (Nov 01, 2024)3 benchmarks—––23––3–
107GPT 4o (Aug 06, 2024)8 benchmarks––22–198–
108GPT 4o Mini (Jul 18, 2024)14 benchmarks18–22–1714–
109Claude 3.5 Sonnet (Jun 20, 2024)7 benchmarks––22–267–
110Llama 3.1 405B Instructopen268 GB · 8 benchmarks––22–228268 GB
111GPT 4o (May 13, 2024)7 benchmarks––22–247–
112Mistral Large Instruct 2411open74.6 GB · 6 benchmarks––22–22674.6 GB
113GPT 4o (Nov 20, 2024)10 benchmarks25–21172410–
114GPT 4 Turbo (Apr 09, 2024)8 benchmarks––21–238–
115Mistral Small 3.1 24B Instruct 2503open15.1 GB · 7 benchmarks––211721715.1 GB
116Mistral Large Instruct 2407open80.9 GB · 7 benchmarks––20–22780.9 GB
117Claude 3.5 Haiku (Oct 22, 2024)9 benchmarks29–2013–9–
118Mistral Small 24B Instruct 2501open14.9 GB · 4 benchmarks––20––414.9 GB
119Llama 3.1 Tulu 3 70B DPOopen43.3 GB · 3 benchmarks—––19––343.3 GB
120Llama 3.3 70B Instructopen46.6 GB · 13 benchmarks22–1917211346.6 GB

The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.

Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.

VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.

How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.