Coding

SWE-bench Verified Leaderboard

SWE-bench Verified tests whether a model can resolve real GitHub issues from popular open-source Python projects, scored on the official swebench.com leaderboard as the percentage of human-validated issues actually fixed. It is the headline measure of practical, agentic software-engineering ability — where open-weight models like Qwen3-Coder, GLM-4.6, Kimi K2 and DeepSWE are now competitive with the frontier.

Source: swebench16 open models ranked+146 proprietaryData through Feb 2026

All models ranked on SWE-bench Verified

Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.

#ModelScore
1live-SWE-agent + Claude 4.5 Opus medium (20251101) · proprietary
79.2%
2Sonar Foundation Agent + Claude 4.5 Opus · proprietary
79.2%
3TRAE + Doubao-Seed-Code · proprietary
78.8%
4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) · proprietary
77.4%
5Atlassian Rovo Dev (2025-09-02) · proprietary
76.8%
6Claude 4.5 Opus (high) · proprietary
76.8%
7EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet · proprietary
76.8%
8ACoder · proprietary
76.4%
9Gemini 3 Flash (high) · proprietary
75.8%
10MiniMax M2.5 · 228.7B
75.8%
11Claude 4.6 Opus · proprietary
75.6%
12Warp · proprietary
75.6%
13TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro · proprietary
75.2%
14Harness AI · proprietary
74.8%
15Sonar Foundation Agent + Claude 4.5 Sonnet · proprietary
74.8%
16JoyCode + Claude 4 Sonnet + GPT-4.1 · proprietary
74.6%
17Lingxi-v1.5_claude-4-sonnet-20250514 · proprietary
74.6%
18Claude 4.5 Opus (20251101) (medium) · proprietary
74.4%
19Prometheus-v1.2.1 + GPT-5 · proprietary
74.4%
20Refact.ai Agent + Claude 4 Sonnet + o4-mini · proprietary
74.4%
21Gemini 3 Pro Preview (2025-11-18) · proprietary
74.2%
22Salesforce AI Research SAGE (OpenHands) · proprietary
73.8%
23Tools + Claude 4 Opus (2025-05-22) · proprietary
73.2%
24Salesforce AI Research SAGE (bash-only) · proprietary
73.0%
25GLM 5 · 753.9B
72.8%
26GPT 5.2 (high) · proprietary
72.8%
27GPT 5.2 Codex · proprietary
72.8%
28Tools + Claude 4 Sonnet (2025-05-22) · proprietary
72.4%
29GPT 5.2 (2025-12-11) (high) · proprietary
71.8%
30OpenHands + GPT-5 · proprietary
71.8%
31Claude 4.5 Sonnet (high) · proprietary
71.4%
32Bloop · proprietary
71.2%
33Kimi K2 Instruct 0905 · 1026.5B
71.2%
34Prometheus-v1.2 + GPT-5 · proprietary
71.2%
35Qodo Command · proprietary
71.2%
36Kimi K2.5 · 1026.9B
70.8%
37Moatless Tools + Claude 4 Sonnet · proprietary
70.8%
38Claude 4.5 Sonnet (20250929) · proprietary
70.6%
39TRAE · proprietary
70.6%
40Augment Agent v1 · proprietary
70.4%
41OpenHands + Claude 4 Sonnet · proprietary
70.4%
42Refact.ai Agent · proprietary
70.4%
43devlo · proprietary
70.2%
44DeepSeek V3.2 · 685.4B
70.0%
45Zencoder (2025-04-30) · proprietary
70.0%
46Gemini 3 Pro · proprietary
69.6%
47Qwen3 Coder 480B A35B Instruct · 480.2B
69.6%
48GPT 5.2 (2025-12-11) · proprietary
69.0%
49GLM 4.6 · 356.8B
68.2%
50Nemotron-CORTEXA · proprietary
68.2%
51Claude 4 Opus (20250514) · proprietary
67.6%
52Claude 4.5 Haiku (high) · proprietary
66.6%
53SWE-agent + Claude 4 Sonnet · proprietary
66.6%
54Aime-coder v1 + Anthopic Claude 3.7 Sonnet · proprietary
66.4%
55GPT 5.1 (2025-11-13) (medium) · proprietary
66.0%
56GPT 5.1 Codex (medium) · proprietary
66.0%
57OpenHands · proprietary
65.8%
58Amazon Q Developer Agent (v20250405-dev) · proprietary
65.4%
59Augment Agent v0 · proprietary
65.4%
60Kimi K2 Instruct · 1026.4B
65.4%
61GPT 5 (2025-08-07) (medium) · proprietary
65.0%
62Claude 4 Sonnet (20250514) · proprietary
64.9%
63PatchPilot-v1.1 · proprietary
64.6%
64W&B Programmer O1 crosscheck5 · proprietary
64.6%
65GLM 4.5 · 358.3B
64.2%
66AgentScope · proprietary
63.4%
67Kimi K2 Thinking · 1026.4B
63.4%
68Tools + Claude 3.7 Sonnet (2025-02-24) · proprietary
63.2%
69Blackbox AI Agent · proprietary
62.8%
70EPAM AI/Run Developer Agent v20250219 + Anthopic Claude 3.5 Sonnet · proprietary
62.8%
71SWE-agent + Claude 3.7 Sonnet w/ Review Heavy · proprietary
62.4%
72CodeStory Midwit Agent + swe-search · proprietary
62.2%
73MiniMax M2 · 228.7B
61.0%
74OpenHands + 4x Scaled (2024-02-03) · proprietary
60.8%
75Qwen3 Coder 30B A3B Instruct · 30.5B
60.4%
76Learn-by-interact · proprietary
60.2%
77GPT 5 mini (2025-08-07) (medium) · proprietary
59.8%
78DeepSWE Preview · 32.8B
58.8%
79o3 (2025-04-16) · proprietary
58.4%
80Emergent E1 (v2024-12-23) · proprietary
57.2%
81Artemis Agent v2 (2025-09-24) · proprietary
57.0%
82Gru(2024-12-08) · proprietary
57.0%
83SWE-Rizzo · proprietary
56.6%
84devstral-small-2512 · proprietary
56.4%
85GPT 5 mini · proprietary
56.2%
86EPAM AI/Run Developer Agent v20241212 + Anthopic Claude 3.5 Sonnet · proprietary
55.4%
87Amazon Q Developer Agent (v20241202-dev) · proprietary
55.0%
88devstral-2512 · proprietary
53.8%
89FrogBoss-32B-2510 · proprietary
53.6%
90Gemini 2.5 Pro (2025-05-06) · proprietary
53.6%
91Bracket.sh · proprietary
53.2%
92OpenHands + CodeAct v2.1 (claude-3-5-sonnet-20241022) · proprietary
53.0%
93Claude 3.7 Sonnet (20250219) · proprietary
52.8%
94Google Jules + Gemini 2.0 Flash (v20241212-experimental) · proprietary
52.2%
95Engine Labs (2024-11-25) · proprietary
51.8%
96AutoCodeRover-v2.1 (Claude-3.5-Sonnet-20241022) · proprietary
51.6%
97Agentless-1.5 + Claude-3.5 Sonnet (20241022) · proprietary
50.8%
98Bytedance MarsCode Agent · proprietary
50.0%
99Solver (2024-10-28) · proprietary
50.0%
100nFactorial (2024-11-05) · proprietary
49.2%
101Tools + Claude 3.5 Sonnet (2024-10-22) · proprietary
49.0%
102Composio SWE-Kit (2024-10-25) · proprietary
48.6%
103AppMap Navie v2 · proprietary
47.2%
104Qwen2.5 Coder 32B Instruct · 32.8B
47.0%
105Devstral-Small-2505 · proprietary
46.8%
106Emergent E1 (v2024-10-12) · proprietary
46.6%
107AutoCodeRover-v2.0 (Claude-3.5-Sonnet-20241022) · proprietary
46.2%
108PatchPilot + Co-PatcheR · proprietary
46.0%
109Solver (2024-09-12) · proprietary
45.4%
110Gru(2024-08-24) · proprietary
45.2%
111FrogMini-14B-2510 · proprietary
45.0%
112o4-mini (2025-04-16) · proprietary
45.0%
113CodeShellAgent + Gemini 2.0 Flash (Experimental) · proprietary
44.2%
114Agentless Lite + O3 Mini (20250214) · proprietary
42.4%
115Amazon Nova Premier 1.0 (2025-04-30) · proprietary
42.4%
116DeepSeek v3 0324 · 684.5B
42.0%
117nFactorial (2024-10-30) · proprietary
41.6%
118ugaiforge · proprietary
41.6%
119SWE-RL (Llama3-SWE-RL-70B + Agentless Mini) (20250226) · proprietary
41.2%
120Composio SWEkit + Claude 3.5 Sonnet (2024-10-16) · proprietary
40.6%
121Honeycomb · proprietary
40.6%
122Nebius AI Qwen 2.5 72B Generator + LLama 3.1 70B Critic · proprietary
40.6%
123Tools + Claude 3.5 Haiku · proprietary
40.6%
124Qwen 2.5 · proprietary
40.2%
125EPAM AI/Run Developer Agent v20241029 + Anthopic Claude 3.5 Sonnet · proprietary
39.6%
126GPT 4.1 (2025-04-14) · proprietary
39.6%
127Agentless-1.5 + GPT 4o (2024-05-13) · proprietary
38.8%
128Amazon Q Developer Agent (v20240719-dev) · proprietary
38.8%
129AutoCodeRover (v20240620) + GPT 4o (2024-05-13) · proprietary
38.4%
130devstral-small-2507 · proprietary
38.0%
131Factory Code Droid · proprietary
37.0%
132GPT 5 nano (2025-08-07) (medium) · proprietary
34.8%
133SWE-agent + Claude 3.5 Sonnet · proprietary
33.6%
134MASAI + GPT 4o (2024-06-12) · proprietary
32.6%
135Artemis Agent v1 (2024-11-20) · proprietary
32.0%
136nFactorial (2024-10-07) · proprietary
31.6%
137SWE-Fixer (Qwen2.5-7b retriever + Qwen2.5-72b editor) 20241128 · proprietary
30.2%
138Lingma Agent + Lingma SWE-GPT 72b (v0925) · proprietary
28.8%
139Gemini 2.5 Flash (2025-04-17) · proprietary
28.7%
140EPAM AI/Run Developer Agent + GPT4o · proprietary
27.0%
141AppMap Navie + GPT 4o (2024-05-13) · proprietary
26.2%
142GPT OSS 120B · 116.8B
26.0%
143nFactorial (2024-10-01) · proprietary
25.8%
144Amazon Q Developer Agent (v20240430-dev) · proprietary
25.6%
145Lingma Agent + Lingma SWE-GPT 72b (v0918) · proprietary
25.0%
146GPT 4.1 mini (2025-04-14) · proprietary
23.9%
147MCTS-Refine-7B · proprietary
23.2%
148SWE-agent + GPT 4o (2024-05-13) · proprietary
23.2%
149SWE-agent + GPT 4 (1106) · proprietary
22.4%
150GPT 4o (2024-11-20) · proprietary
21.6%
151Llama 4 Maverick Instruct · proprietary
21.0%
152Lingma Agent + Lingma SWE-GPT 7b (v0925) · proprietary
18.2%
153SWE-agent + Claude 3 Opus · proprietary
15.8%
154Gemini 2.0 Flash · proprietary
13.5%
155Lingma Agent + Lingma SWE-GPT 7b (v0918) · proprietary
10.2%
156Llama 4 Scout Instruct · proprietary
9.1%
157RAG + Claude 3 Opus · proprietary
7.0%
158RAG + Claude 2 · proprietary
4.4%
159RAG + GPT 4 (1106) · proprietary
2.8%
160RAG + SWE-Llama 7B · proprietary
1.4%
161RAG + SWE-Llama 13B · proprietary
1.2%
162RAG + ChatGPT 3.5 · proprietary
0.4%

Score vs model size

Which models give the most quality for their size — the ones worth running locally.

100B1Tmodel size (log scale) →75.8%26.0%GLM 5 · 754B · 72.8%Kimi K2 Instruct 0905 · 1T · 71.2%Kimi K2.5 · 1T · 70.8%DeepSeek V3.2 · 685B · 70.0%Qwen3 Coder 480B A35B Instruct · 480B · 69.6%GLM 4.6 · 357B · 68.2%Kimi K2 Instruct · 1T · 65.4%GLM 4.5 · 358B · 64.2%Kimi K2 Thinking · 1T · 63.4%DeepSWE Preview · 33B · 58.8%Qwen2.5 Coder 32B Instruct · 33B · 47.0%DeepSeek v3 0324 · 685B · 42.0%GPT OSS 120B · 117B · 26.0%Qwen3 Coder 30B A3B Instruct · 31B · 60.4%Qwen3 Coder 30B A3B I…MiniMax M2 · 229B · 61.0%MiniMax M2MiniMax M2.5 · 229B · 75.8%MiniMax M2.5
Each dot is a model. Up = higher score, left = smaller (easier to run locally). The dashed line marks the efficiency frontier — the best score you can get at each size or smaller.
  • Qwen3 Coder 30B A3B Instruct, 31B, score 60.4% — on the efficiency frontier (best score at its size or smaller).
  • MiniMax M2, 229B, score 61.0% — on the efficiency frontier (best score at its size or smaller).
  • MiniMax M2.5, 229B, score 75.8% — on the efficiency frontier (best score at its size or smaller).

SWE-bench Verified: frequently asked questions

What is the best open LLM on SWE-bench Verified?
MiniMax M2.5 is the top open model on SWE-bench Verified, scoring 75.8%. Among all models tested — including proprietary ones — it ranks #9. The top model overall is Sonar Foundation Agent + Claude 4.5 Opus at 79.2%.
What's the best SWE-bench Verified model you can run on a 24 GB GPU?
Qwen3 Coder 30B A3B Instruct is the highest-scoring open model that fits in 24 GB at 4-bit quantization (about 17 GB), scoring 60.4% on SWE-bench Verified.
Can open models match proprietary models on SWE-bench Verified?
Not quite on SWE-bench Verified: the strongest proprietary model (Sonar Foundation Agent + Claude 4.5 Opus) scores 79.2%, ahead of the best open model (MiniMax M2.5) at 75.8% — but you can run the open one yourself.

Scores aggregated from swebench. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.