Best LLMs for coding: open and proprietary

Open and proprietary models together on one 0–100 scale (coding). Switch to local models to see only what you can download and run.

40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built

Models ranked by coding llmrun Score
#Modelllmrun ScoreCodingAgentsMathScienceReasoningBenchmarksVRAM
1GPT 6 Astra Max19 benchmarks837296578619–
2Claude Fable 5.1 Max15 benchmarks79–95577515–
3GPT 6 Sol Max18 benchmarks79–94567518–
4Claude Fable 5 Max20 benchmarks786294547420–
5Claude Fable 5.19 benchmarks78––56749–
6Claude Opus 59 benchmarks78––54749–
7Claude Opus 5.5 Max17 benchmarks78–96588217–
8GPT 5.6 Sol Max21 benchmarks787091577721–
9Claude Opus 5 Max22 benchmarks787291557522–
10Claude Sonnet 5.53 benchmarks—75––57–3–
11GPT 5.6 Sol9 benchmarks75––55729–
12Claude Sonnet 5.5 Max13 benchmarks75–93588113–
13GPT 5.59 benchmarks74––53729–
14GPT 6.1 Sol3 benchmarks—73––54–3–
15GPT 5.6 Terra Max20 benchmarks736787557120–
16Kimi K3open1674 GB · 26 benchmarks7361815263261674 GB
17GPT 5.6 Terra10 benchmarks70––536510–
18GPT 5.3 Codex2 benchmarks—70––––2–
19GPT 5.6 Luna Max20 benchmarks696382486220–
20GPT 6 Luna Max18 benchmarks69–82476018–
21GPT 5.4 (Mar 05, 2026)20 benchmarks695778516720–
22Gemini 3.8 Flash6 benchmarks69––45656–
23Claude Opus 4.77 benchmarks6875––547–
24Claude Opus 4.7 Max15 benchmarks67–73426415–
25GPT 6 Luna5 benchmarks67––47555–
26GLM 5.3open456 GB · 21 benchmarks676872495821456 GB
27Muse Spark 1.19 benchmarks66596948–9–
28Grok 4.516 benchmarks65–66476016–
29Claude Opus 4.68 benchmarks6464–––8–
30Claude Opus 4.8 Max19 benchmarks645582486619–
31GPT 6.1 Sol Max13 benchmarks64–96568313–
32DeepSeek V4 Pro 0813open991 GB · 21 benchmarks63–71466521991 GB
33GPT 5.2 Codex8 benchmarks6248–––8–
34Gemini 3 Pro Preview17 benchmarks625560465417–
35Qwen3.7 Max17 benchmarks59–68435817–
36DeepSeek V4 Flash 0731open183 GB · 21 benchmarks59–71456221183 GB
37GPT 5.1 (Nov 13, 2025)14 benchmarks59–––5014–
38Muse Spark 1.27 benchmarks59––49627–
39GPT 5 (Aug 07, 2025)20 benchmarks58–62404820–
40GLM 5.2open456 GB · 24 benchmarks586068475224456 GB
41Kimi K2.6open620 GB · 18 benchmarks57–63435118620 GB
42Gemini 3.7 Flash15 benchmarks56–74487015–
43GPT 5.4 2026 03.056 benchmarks56–––336–
44O3 Pro (Jun 10, 2025)6 benchmarks55–––446–
45Grok 4.2011 benchmarks5549––6311–
46DeepSeek V4.1 Flashopen458 GB · 10 benchmarks54–76455710458 GB
47MiMo V2.5 Proopen615 GB · 6 benchmarks54––38426615 GB
48Kimi K2.7 Codeopen620 GB · 19 benchmarks534661405019620 GB
49GLM 5.1open457 GB · 13 benchmarks535457404613457 GB
50O3 (Apr 16, 2025)19 benchmarks52–52354619–
51Gemini 3.6 Flash16 benchmarks52–66456316–
52GLM 5.3 Flashopen195 GB · 17 benchmarks526362443717195 GB
53MiniMax M3open257 GB · 19 benchmarks524046413819257 GB
54Qwen3.8 27Bopen17.4 GB · 9 benchmarks51–573750917.4 GB
55GPT 5 Mini (Aug 07, 2025)15 benchmarks50–57–4215–
56Grok Build 0.15 benchmarks50––41–5–
57DeepSeek V4 Proopen960 GB · 22 benchmarks49–57444922960 GB
58Grok 4 (Jul 09)12 benchmarks4930––4812–
59Kimi K2.5open620 GB · 20 benchmarks4937–404520620 GB
60GLM 5open457 GB · 15 benchmarks4945––4015457 GB
61O4 Mini (Apr 16, 2025)19 benchmarks49–52344219–
62MiniMax M2.5open138 GB · 11 benchmarks4737––4511138 GB
63Qwen3.6 Plus15 benchmarks47–55384115–
64DeepSeek V3.1 Terminusopen415 GB · 5 benchmarks47––31395415 GB
65Gemma 4 31B ITopen20.4 GB · 11 benchmarks47––32401120.4 GB
66DeepSeek R1 0528open415 GB · 11 benchmarks46–44–3211415 GB
67DeepSeek V3.2 Expopen415 GB · 10 benchmarks46––304410415 GB
68Step 3.7 Flashopen133 GB · 3 benchmarks—46––30–3133 GB
69DeepSeek V4 Flashopen175 GB · 10 benchmarks46––364310175 GB
70Mercury 24 benchmarks45––29–4–
71Qwen3.6 35B A3Bopen22.0 GB · 12 benchmarks44–4935381222.0 GB
72Inklingopen572 GB · 21 benchmarks43–52405321572 GB
73Gemma 4 26B A4B ITopen16.1 GB · 9 benchmarks43––3033916.1 GB
74Claude Sonnet 4 (May 14, 2025)4 benchmarks43––––4–
75Gemini 3.5 Flash Lite11 benchmarks43–46–4311–
76Kimi K2 Thinkingopen620 GB · 9 benchmarks4334–––9620 GB
77MiMo V2.5open187 GB · 4 benchmarks43––33–4187 GB
78NVIDIA Nemotron 3 Ultra 550B A55B BF16open370 GB · 14 benchmarks43–52374614370 GB
79Qwen3.7 Plus9 benchmarks42––40469–
80O3 Mini (Jan 31, 2025)18 benchmarks42–47323118–
81Qwen3 235B A22B Thinking 2507open142 GB · 13 benchmarks42––343713142 GB
82Qwen3.6 27Bopen17.4 GB · 12 benchmarks42–5336371217.4 GB
83GPT 5 Nano (Aug 07, 2025)15 benchmarks42–48–2515–
84Mistral Medium 26049 benchmarks41––30339–
85MiniMax M2.7open138 GB · 6 benchmarks41––35–6138 GB
86Qwen3 235B A22B Instruct 2507open142 GB · 8 benchmarks41–––318142 GB
87Kimi K2 Instructopen620 GB · 10 benchmarks4128––2510620 GB
88GLM 4.7open216 GB · 13 benchmarks413251363513216 GB
89Qwen3 235B A22Bopen142 GB · 10 benchmarks41–––3110142 GB
90GPT OSS 20Bopen12.9 GB · 11 benchmarks40––24261112.9 GB
91Ring 2.6 1Topen677 GB · 3 benchmarks—40––33–3677 GB
92Qwen3 Coder 480B A35B Instructopen289 GB · 6 benchmarks—4031–––6289 GB
93MiMo v2 Flashopen186 GB · 3 benchmarks—40––17–3186 GB
94Kimi K2 Instruct 0905open620 GB · 6 benchmarks40––––6620 GB
95DeepSeek R1open415 GB · 14 benchmarks39–40282914415 GB
96DeepSeek v3 0324open415 GB · 13 benchmarks39–33272413415 GB
97GPT 4.1 (Apr 14, 2025)17 benchmarks39–34262617–
98Claude 3.5 Sonnet (Oct 22, 2024)11 benchmarks382623212911–
99GLM 4.5open216 GB · 7 benchmarks3832–––7216 GB
100Grok 3 Mini Beta5 benchmarks38–48––5–
101Grok Code Fast 13 benchmarks—38––––3–
102Qwen3.5 27Bopen17.4 GB · 6 benchmarks38–––41617.4 GB
103GPT OSS 120Bopen70.5 GB · 20 benchmarks3714–31302070.5 GB
104DeepSeek v3open415 GB · 10 benchmarks37–26222110415 GB
105GPT 4.5 Preview (Feb 27, 2025)11 benchmarks36–33272811–
106GLM 4.6open215 GB · 6 benchmarks3631–29–6215 GB
107NVIDIA Nemotron 3 Super 120B A12B BF16open74.7 GB · 4 benchmarks36––27–474.7 GB
108Gemini 2.5 Flash Lite Preview Thinking (Jun 17)5 benchmarks35–––245–
109DeepSeek V3.2open415 GB · 13 benchmarks3536––4313415 GB
110Qwen3 Coder Nextopen48.2 GB · 3 benchmarks—35––23–348.2 GB
111Qwen3 32Bopen20.3 GB · 9 benchmarks33––2626920.3 GB
112Mistral Large 3 675B Instruct 2512open446 GB · 5 benchmarks33––26255446 GB
113Mistral Medium 25086 benchmarks33––24266–
114GPT 4.1 Mini (Apr 14, 2025)16 benchmarks32–36272616–
115Trinity Large Thinkingopen263 GB · 3 benchmarks—32––26–3263 GB
116Claude 3.5 Haiku (Oct 22, 2024)9 benchmarks29–2013–9–
117GPT 4o (Nov 20, 2024)10 benchmarks25–21172410–
118Llama 4 Maverick 17B 128E Instructopen265 GB · 17 benchmarks25–29262317265 GB
119Llama 3.3 70B Instructopen46.6 GB · 13 benchmarks22–1917211346.6 GB
120GPT 4.1 Nano (Apr 14, 2025)13 benchmarks21–30171713–

The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.

Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.

VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.

How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.