Best LLMs for science: open and proprietary

Open and proprietary models together on one 0–100 scale (scientific knowledge). Switch to local models to see only what you can download and run.

40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built

Models ranked by science llmrun Score
#Modelllmrun ScoreCodingAgentsMathScienceReasoningBenchmarksVRAM
1Claude Opus 5.54 benchmarks–––59744–
2Claude Opus 5.5 Max17 benchmarks78–96588217–
3Claude Sonnet 5.5 Max13 benchmarks75–93588113–
4Claude Fable 5.1 Max15 benchmarks79–95577515–
5Claude Sonnet 5.53 benchmarks—75––57–3–
6GPT 5.6 Sol Max21 benchmarks787091577721–
7GPT 6 Astra Max19 benchmarks837296578619–
8Claude Fable 5.19 benchmarks78––56749–
9GPT 6 Sol Max18 benchmarks79–94567518–
10GPT 6.1 Sol Max13 benchmarks64–96568313–
11GPT 5.4 Pro (Mar 05, 2026)8 benchmarks––8356748–
12GPT 5.6 Sol9 benchmarks75––55729–
13Claude Opus 5 Max22 benchmarks787291557522–
14GPT 5.6 Terra Max20 benchmarks736787557120–
15GPT 6 Sol4 benchmarks–––54684–
16Claude Opus 59 benchmarks78––54749–
17Claude Fable 5 Max20 benchmarks786294547420–
18GPT 6.1 Sol3 benchmarks—73––54–3–
19Muse Spark 1.3 Max6 benchmarks––7854616–
20GPT 5.59 benchmarks74––53729–
21GPT 5.6 Terra10 benchmarks70––536510–
22Kimi K3open1674 GB · 26 benchmarks7361815263261674 GB
23Step 5 Preview2 benchmarks—–––52–2–
24GPT 5.4 (Mar 05, 2026)20 benchmarks695778516720–
25GLM 5.3open456 GB · 21 benchmarks676872495821456 GB
26Muse Spark 1.27 benchmarks59––49627–
27Grok 4.79 benchmarks––6349639–
28Muse Spark 1.19 benchmarks66596948–9–
29GPT 5.6 Luna Max20 benchmarks696382486220–
30Claude Opus 4.8 Max19 benchmarks645582486619–
31GPT 5.6 Luna8 benchmarks–––48588–
32Gemini 3.7 Flash15 benchmarks56–74487015–
33GPT 6 Luna Max18 benchmarks69–82476018–
34Muse Spark6 benchmarks––5847–6–
35GLM 5.2open456 GB · 24 benchmarks586068475224456 GB
36Grok 4.516 benchmarks65–66476016–
37GPT 6 Luna5 benchmarks67––47555–
38DeepSeek V4 Pro 0813open991 GB · 21 benchmarks63–71466521991 GB
39Gemini 3 Pro Preview17 benchmarks625560465417–
40Gemini 3.6 Flash16 benchmarks52–66456316–
41Gemini 3.8 Flash6 benchmarks69––45656–
42DeepSeek V4.1 Flashopen458 GB · 10 benchmarks54–76455710458 GB
43Claude Opus 4.6 Max12 benchmarks––71455512–
44DeepSeek V4 Flash 0731open183 GB · 21 benchmarks59–71456221183 GB
45GLM 5.3 Flashopen195 GB · 17 benchmarks526362443717195 GB
46DeepSeek V4 Proopen960 GB · 22 benchmarks49–57444922960 GB
47Qwen3.7 Max17 benchmarks59–68435817–
48Kimi K2.6open620 GB · 18 benchmarks57–63435118620 GB
49Claude Opus 4.7 Max15 benchmarks67–73426415–
50Grok Build 0.15 benchmarks50––41–5–
51Inkling Smallopen160 GB · 12 benchmarks––57415412160 GB
52MiniMax M3open257 GB · 19 benchmarks524046413819257 GB
53Grok 4.311 benchmarks––57415211–
54GPT 5 (Aug 07, 2025)20 benchmarks58–62404820–
55Kimi K2.7 Codeopen620 GB · 19 benchmarks534661405019620 GB
56GPT 5.4 Mini (Mar 17, 2026)12 benchmarks––60404712–
57Kimi K2.5open620 GB · 20 benchmarks4937–404520620 GB
58GLM 5.1open457 GB · 13 benchmarks535457404613457 GB
59Qwen3.7 Plus9 benchmarks42––40469–
60Inklingopen572 GB · 21 benchmarks43–52405321572 GB
61GPT 5.4 Nano (Mar 17, 2026)6 benchmarks–––39426–
62MiMo V2.5 Proopen615 GB · 6 benchmarks54––38426615 GB
63Claude Sonnet 5 Max13 benchmarks––77385713–
64Qwen3.6 Plus15 benchmarks47–55384115–
65Gemini 2.5 Pro Preview (Jun 05)6 benchmarks–––38–6–
66Gemini 2.5 Pro13 benchmarks–2949374313–
67Qwen3.8 27Bopen17.4 GB · 9 benchmarks51–573750917.4 GB
68NVIDIA Nemotron 3 Ultra 550B A55B BF16open370 GB · 14 benchmarks43–52374614370 GB
69Gemini 2.5 Pro Exp (Mar 25)6 benchmarks–––37–6–
70DeepSeek V4 Flashopen175 GB · 10 benchmarks46––364310175 GB
71GLM 4.7open216 GB · 13 benchmarks413251363513216 GB
72GPT 5.5 Instant7 benchmarks––4536–7–
73Qwen3.6 27Bopen17.4 GB · 12 benchmarks42–5336371217.4 GB
74O3 (Apr 16, 2025)19 benchmarks52–52354619–
75Qwen3.6 35B A3Bopen22.0 GB · 12 benchmarks44–4935381222.0 GB
76MiniMax M2.7open138 GB · 6 benchmarks41––35–6138 GB
77Claude Sonnet 4.6 Max11 benchmarks––70345911–
78Qwen3 235B A22B Thinking 2507open142 GB · 13 benchmarks42––343713142 GB
79O4 Mini (Apr 16, 2025)19 benchmarks49–52344219–
80Qwen3.5 35B A3Bopen22.0 GB · 8 benchmarks–––3437822.0 GB
81MiMo V2.5open187 GB · 4 benchmarks43––33–4187 GB
82Ring 2.6 1Topen677 GB · 3 benchmarks—40––33–3677 GB
83Claude Sonnet 4.5 (Sep 29, 2025)11 benchmarks–42–324611–
84O3 Mini (Jan 31, 2025)18 benchmarks42–47323118–
85Gemma 4 31B ITopen20.4 GB · 11 benchmarks47––32401120.4 GB
86Nova 2.0 Pro Preview2 benchmarks—–––32–2–
87Qwen3.5 9Bopen6.4 GB · 9 benchmarks–––323096.4 GB
88GPT OSS 120Bopen70.5 GB · 20 benchmarks3714–31302070.5 GB
89DeepSeek V3.1 Terminusopen415 GB · 5 benchmarks47––31395415 GB
90Step 3.7 Flashopen133 GB · 3 benchmarks—46––30–3133 GB
91Cogito 671B V2.1open407 GB · 2 benchmarks—–––30–2407 GB
92Gemma 4 26B A4B ITopen16.1 GB · 9 benchmarks43––3033916.1 GB
93Mistral Medium 26049 benchmarks41––30339–
94DeepSeek V3.2 Expopen415 GB · 10 benchmarks46––304410415 GB
95Magistral Medium 25092 benchmarks—–––29–2–
96Mercury 24 benchmarks45––29–4–
97GLM 4.6open215 GB · 6 benchmarks3631–29–6215 GB
98Qwen3 30B A3B Thinking 2507open18.7 GB · 8 benchmarks–––2827818.7 GB
99Command A Plus 05 2026 BF16open132 GB · 2 benchmarks—–––28–2132 GB
100DeepSeek R1open415 GB · 14 benchmarks39–40282914415 GB
101Gemini 2.5 Pro Preview (May 06)5 benchmarks–––27–5–
102GPT 4.5 Preview (Feb 27, 2025)11 benchmarks36–33272811–
103NVIDIA Nemotron 3 Super 120B A12B BF16open74.7 GB · 4 benchmarks36––27–474.7 GB
104DeepSeek v3 0324open415 GB · 13 benchmarks39–33272413415 GB
105GPT 4.1 Mini (Apr 14, 2025)16 benchmarks32–36272616–
106Trinity Large Thinkingopen263 GB · 3 benchmarks—32––26–3263 GB
107GPT 4.1 (Apr 14, 2025)17 benchmarks39–34262617–
108GPT 5.1 2025 11.137 benchmarks–––26277–
109Mistral Large 3 675B Instruct 2512open446 GB · 5 benchmarks33––26255446 GB
110Qwen3 32Bopen20.3 GB · 9 benchmarks33––2626920.3 GB
111Llama 4 Maverick 17B 128E Instructopen265 GB · 17 benchmarks25–29262317265 GB
112Qwen3.5 122B A10Bopen82.6 GB · 6 benchmarks–––2643682.6 GB
113Claude Opus 4 (May 14, 2025)7 benchmarks–––26467–
114Qwen3 14Bopen9.5 GB · 8 benchmarks–––252489.5 GB
115Mistral Medium 25086 benchmarks33––24266–
116GPT OSS 20Bopen12.9 GB · 11 benchmarks40––24261112.9 GB
117Qwen3 Coder Nextopen48.2 GB · 3 benchmarks—35––23–348.2 GB
118Mistral Medium 25055 benchmarks––3323–5–
119DeepSeek v3open415 GB · 10 benchmarks37–26222110415 GB
120Gemini 2.0 Flash Thinking Exp (Jan 21)6 benchmarks–––22–6–

The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.

Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.

VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.

How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.