Best LLMs: open and proprietary

Open and proprietary models together on one 0–100 scale (overall capability). Switch to local models to see only what you can download and run.

40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built

Models ranked by overall llmrun Score
#Modelllmrun ScoreCodingAgentsMathScienceReasoningBenchmarksVRAM
1GPT 6 Astra6 benchmarks–87––746–
2GPT 6 Astra Max19 benchmarks837296578619–
3Claude Opus 5.5 Max17 benchmarks78–96588217–
4GPT 6.1 Sol Max13 benchmarks64–96568313–
5Claude Fable 5.1 Max15 benchmarks79–95577515–
6Claude Sonnet 5.5 Max13 benchmarks75–93588113–
7GPT 6 Sol Max18 benchmarks79–94567518–
8GPT 5.6 Sol Max21 benchmarks787091577721–
9Claude Fable 5.19 benchmarks78––56749–
10GPT 5.6 Sol Promax6 benchmarks––––796–
11Claude Opus 5 Max22 benchmarks787291557522–
12Claude Opus 59 benchmarks78––54749–
13Claude Opus 5.54 benchmarks–––59744–
14Claude Fable 5 Max20 benchmarks786294547420–
15Claude Fable 56 benchmarks––––736–
16GPT 5.5 Pro7 benchmarks––90–707–
17GPT 5.6 Sol9 benchmarks75––55729–
18GPT 5.59 benchmarks74––53729–
19Claude Opus 4.77 benchmarks6875––547–
20GPT 5.6 Terra Max20 benchmarks736787557120–
21Gemini 3.1 Pro Preview8 benchmarks––––688–
22GPT 5.4 Pro (Mar 05, 2026)8 benchmarks––8356748–
23Gemini 3.8 Flash6 benchmarks69––45656–
24GPT 6 Sol4 benchmarks–––54684–
25Claude Opus 4.85 benchmarks–64––565–
26GPT 5.6 Terra10 benchmarks70––536510–
27Grok 4.65 benchmarks–72–––5–
28Claude Opus 4.8 Max19 benchmarks645582486619–
29Kimi K3open1674 GB · 26 benchmarks7361815263261674 GB
30Claude Opus 4.68 benchmarks6464–––8–
31Claude Sonnet 55 benchmarks–62–––5–
32Gemini 3.7 Flash15 benchmarks56–74487015–
33GPT 5.4 (Mar 05, 2026)20 benchmarks695778516720–
34GPT 5.6 Luna Max20 benchmarks696382486220–
35Muse Spark 1.3 Max6 benchmarks––7854616–
36Qwen3.8 Max10 benchmarks––78–6210–
37GPT 6 Luna Max18 benchmarks69–82476018–
38Muse Spark 1.27 benchmarks59––49627–
39Claude Sonnet 5 Max13 benchmarks––77385713–
40Claude Opus 4.7 Max15 benchmarks67–73426415–
41GLM 5.3open456 GB · 21 benchmarks676872495821456 GB
42Muse Spark 1.36 benchmarks––76–536–
43Gemini 3.5 Flash4 benchmarks––––654–
44DeepSeek V4 Pro 0813open991 GB · 21 benchmarks63–71466521991 GB
45Qwen3.8 Max (Sep 02)6 benchmarks––72––6–
46Muse Spark 1.19 benchmarks66596948–9–
47Gemini 3 Flash Preview7 benchmarks––––577–
48DeepSeek V4 Flash 0731open183 GB · 21 benchmarks59–71456221183 GB
49Claude Opus 4.6 Max12 benchmarks––71455512–
50DeepSeek V4.1 Flashopen458 GB · 10 benchmarks54–76455710458 GB
51Gemini 3.6 Flash16 benchmarks52–66456316–
52Grok 4.2011 benchmarks5549––6311–
53Grok 4.516 benchmarks65–66476016–
54GPT 5.6 Luna8 benchmarks–––48588–
55GPT 5.2 (Dec 11, 2025)12 benchmarks––65–6112–
56Qwen3.7 Max17 benchmarks59–68435817–
57Claude Sonnet 4.6 Max11 benchmarks––70345911–
58Claude Opus 4.5 (Nov 01, 2025)9 benchmarks–52––559–
59Grok 4.79 benchmarks––6349639–
60GPT 6 Luna5 benchmarks67––47555–
61Claude Sonnet 4.68 benchmarks–43––608–
62Gemini 3 Pro Preview17 benchmarks625560465417–
63GLM 5.2open456 GB · 24 benchmarks586068475224456 GB
64Qwen3.6 Max Preview8 benchmarks––––528–
65GPT 5.2 Codex8 benchmarks6248–––8–
66Kimi K2.6open620 GB · 18 benchmarks57–63435118620 GB
67GPT 5 Pro (Oct 06, 2025)5 benchmarks––64–515–
68GLM 5.3 Flashopen195 GB · 17 benchmarks526362443717195 GB
69Muse Spark6 benchmarks––5847–6–
70Inkling Smallopen160 GB · 12 benchmarks––57415412160 GB
71GPT 5 (Aug 07, 2025)20 benchmarks58–62404820–
72GPT 5.1 (Nov 13, 2025)14 benchmarks59–––5014–
73Kimi K2.7 Codeopen620 GB · 19 benchmarks534661405019620 GB
74Grok 4.20 0309 Reasoning8 benchmarks––58–498–
75GLM 5.1open457 GB · 13 benchmarks535457404613457 GB
76Grok 4.311 benchmarks––57415211–
77GPT 5.4 Mini (Mar 17, 2026)12 benchmarks––60404712–
78DeepSeek V4 Proopen960 GB · 22 benchmarks49–57444922960 GB
79MiMo V2.5 Proopen615 GB · 6 benchmarks54––38426615 GB
80Inklingopen572 GB · 21 benchmarks43–52405321572 GB
81Qwen3.8 27Bopen17.4 GB · 9 benchmarks51–573750917.4 GB
82Claude Sonnet 4.5 (Sep 29, 2025)11 benchmarks–42–324611–
83Gemini 2.5 Pro Preview (Jun 05)6 benchmarks–––38–6–
84Qwen3.6 Plus15 benchmarks47–55384115–
85Qwen3.7 Plus9 benchmarks42––40469–
86O3 (Apr 16, 2025)19 benchmarks52–52354619–
87Grok 4 (Jul 09)12 benchmarks4930––4812–
88O3 Pro (Jun 10, 2025)6 benchmarks55–––446–
89Kimi K2.5open620 GB · 20 benchmarks4937–404520620 GB
90Qwen3.5 397B A17Bopen266 GB · 9 benchmarks––52–469266 GB
91GPT 5 Mini (Aug 07, 2025)15 benchmarks50–57–4215–
92MiniMax M2.5open138 GB · 11 benchmarks4737––4511138 GB
93NVIDIA Nemotron 3 Ultra 550B A55B BF16open370 GB · 14 benchmarks43–52374614370 GB
94DeepSeek Reasoner4 benchmarks–––––4–
95GLM 5open457 GB · 15 benchmarks4945––4015457 GB
96Qwen3.6 27Bopen17.4 GB · 12 benchmarks42–5336371217.4 GB
97Claude Opus 4 (May 14, 2025)7 benchmarks–––26467–
98MiniMax M3open257 GB · 19 benchmarks524046413819257 GB
99GPT 5.4 Nano (Mar 17, 2026)6 benchmarks–––39426–
100Grok 4 Fast6 benchmarks––––416–
101Claude Opus 4.1 (Aug 05, 2025)6 benchmarks––––466–
102Grok 4.1 Fast Reasoning6 benchmarks––––506–
103Qwen3.5 Plus11 benchmarks––––4311–
104O4 Mini (Apr 16, 2025)19 benchmarks49–52344219–
105DeepSeek V3.2open415 GB · 13 benchmarks3536––4313415 GB
106Gemini 3.5 Flash Lite11 benchmarks43–46–4311–
107Qwen3.7 Flash5 benchmarks––49–465–
108Qwen3.5 122B A10Bopen82.6 GB · 6 benchmarks–––2643682.6 GB
109DeepSeek V4 Flashopen175 GB · 10 benchmarks46––364310175 GB
110DeepSeek V3.2 Expopen415 GB · 10 benchmarks46––304410415 GB
111Gemini 2.5 Pro Exp (Mar 25)6 benchmarks–––37–6–
112Gemini 3.1 Flash Lite6 benchmarks––49–386–
113Kimi K2 Thinkingopen620 GB · 9 benchmarks4334–––9620 GB
114Gemini 2.5 Pro13 benchmarks–2949374313–
115Grok Build 0.15 benchmarks50––41–5–
116GLM 4.7open216 GB · 13 benchmarks413251363513216 GB
117MiMo V2.5open187 GB · 4 benchmarks43––33–4187 GB
118Qwen3 235B A22B Thinking 2507open142 GB · 13 benchmarks42––343713142 GB
119DeepSeek V3.1 Terminusopen415 GB · 5 benchmarks47––31395415 GB
120Qwen3.6 35B A3Bopen22.0 GB · 12 benchmarks44–4935381222.0 GB

The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.

Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.

VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.

How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.