Coding

SWE-bench Verified Leaderboard

SWE-bench Verified tests whether a model can resolve real GitHub issues from popular open-source Python projects, scored on the official swebench.com leaderboard as the percentage of human-validated issues actually fixed. It is the headline measure of practical, agentic software-engineering ability — where open-weight models like Qwen3-Coder, GLM-4.6, Kimi K2 and DeepSWE are now competitive with the frontier.

Source: swebench13 open models ranked+150 proprietaryData through Feb 2026

All models ranked on SWE-bench Verified

Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.

#ModelScore
1live-SWE-agent + Claude 4.5 Opus medium (20251101) · proprietary
79.2%
2Sonar Foundation Agent + Claude 4.5 Opus · proprietary
79.2%
3TRAE + Doubao-Seed-Code · proprietary
78.8%
4live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) · proprietary
77.4%
5Atlassian Rovo Dev (2025-09-02) · proprietary
76.8%
6EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet · proprietary
76.8%
7mini-SWE-agent + Claude 4.5 Opus (high reasoning) · proprietary
76.8%
8ACoder · proprietary
76.4%
9mini-SWE-agent + Gemini 3 Flash (high reasoning) · proprietary
75.8%
10mini-SWE-agent + MiniMax M2.5 (high reasoning) · proprietary
75.8%
11mini-SWE-agent + Claude Opus 4.6 · proprietary
75.6%
12Warp · proprietary
75.6%
13TRAE + Claude Sonnet 4 + Opus 4 + Sonnet 3.7 + Gemini 2.5 Pro · proprietary
75.2%
14Harness AI · proprietary
74.8%
15Sonar Foundation Agent + Claude 4.5 Sonnet · proprietary
74.8%
16JoyCode + Claude 4 Sonnet + GPT-4.1 · proprietary
74.6%
17Lingxi-v1.5_claude-4-sonnet-20250514 · proprietary
74.6%
18mini-SWE-agent + Claude 4.5 Opus medium (20251101) · proprietary
74.4%
19Prometheus-v1.2.1 + GPT-5 · proprietary
74.4%
20Refact.ai Agent + Claude 4 Sonnet + o4-mini · proprietary
74.4%
21mini-SWE-agent + Gemini 3 Pro Preview (2025-11-18) · proprietary
74.2%
22Salesforce AI Research SAGE (OpenHands) · proprietary
73.8%
23Tools + Claude 4 Opus (2025-05-22) · proprietary
73.2%
24Salesforce AI Research SAGE (bash-only) · proprietary
73.0%
25mini-SWE-agent + GLM-5 (high reasoning) · proprietary
72.8%
26mini-SWE-agent + GPT-5-2 (high reasoning) · proprietary
72.8%
27mini-SWE-agent + GPT-5-2 Codex · proprietary
72.8%
28Tools + Claude 4 Sonnet (2025-05-22) · proprietary
72.4%
29mini-SWE-agent + GPT-5.2 (2025-12-11) (high reasoning) · proprietary
71.8%
30OpenHands + GPT-5 · proprietary
71.8%
31mini-SWE-agent + Claude 4.5 Sonnet (high reasoning) · proprietary
71.4%
32Bloop · proprietary
71.2%
33Kimi K2 Instruct 0905 · 1026.5B
71.2%
34Prometheus-v1.2 + GPT-5 · proprietary
71.2%
35Qodo Command · proprietary
71.2%
36mini-SWE-agent + Kimi K2.5 (high reasoning) · proprietary
70.8%
37Moatless Tools + Claude 4 Sonnet · proprietary
70.8%
38mini-SWE-agent + Claude 4.5 Sonnet (20250929) · proprietary
70.6%
39TRAE · proprietary
70.6%
40Augment Agent v1 · proprietary
70.4%
41OpenHands + Claude 4 Sonnet · proprietary
70.4%
42Refact.ai Agent · proprietary
70.4%
43devlo · proprietary
70.2%
44mini-SWE-agent + DeepSeek V3.2 (high reasoning) · proprietary
70.0%
45Zencoder (2025-04-30) · proprietary
70.0%
46mini-SWE-agent + Gemini 3 Pro · proprietary
69.6%
47Qwen3 Coder 480B A35B Instruct · 480.2B
69.6%
48mini-SWE-agent + GPT-5.2 (2025-12-11) · proprietary
69.0%
49GLM 4.6 · 356.8B
68.2%
50Nemotron-CORTEXA · proprietary
68.2%
51mini-SWE-agent + Claude 4 Opus (20250514) · proprietary
67.6%
52mini-SWE-agent + Claude 4.5 Haiku (high reasoning) · proprietary
66.6%
53SWE-agent + Claude 4 Sonnet · proprietary
66.6%
54Aime-coder v1 + Anthopic Claude 3.7 Sonnet · proprietary
66.4%
55mini-SWE-agent + GPT-5.1 (2025-11-13) (medium reasoning) · proprietary
66.0%
56mini-SWE-agent + GPT-5.1-codex (medium reasoning) · proprietary
66.0%
57OpenHands · proprietary
65.8%
58Amazon Q Developer Agent (v20250405-dev) · proprietary
65.4%
59Augment Agent v0 · proprietary
65.4%
60Kimi K2 Instruct · 1026.5B
65.4%
61mini-SWE-agent + GPT-5 (2025-08-07) (medium reasoning) · proprietary
65.0%
62mini-SWE-agent + Claude 4 Sonnet (20250514) · proprietary
64.9%
63PatchPilot-v1.1 · proprietary
64.6%
64W&B Programmer O1 crosscheck5 · proprietary
64.6%
65GLM 4.5 · 358.3B
64.2%
66AgentScope · proprietary
63.4%
67Kimi K2 Thinking · 1058.1B
63.4%
68Tools + Claude 3.7 Sonnet (2025-02-24) · proprietary
63.2%
69Blackbox AI Agent · proprietary
62.8%
70EPAM AI/Run Developer Agent v20250219 + Anthopic Claude 3.5 Sonnet · proprietary
62.8%
71SWE-agent + Claude 3.7 Sonnet w/ Review Heavy · proprietary
62.4%
72CodeStory Midwit Agent + swe-search · proprietary
62.2%
73MiniMax M2 · 228.7B
61.0%
74OpenHands + 4x Scaled (2024-02-03) · proprietary
60.8%
75Qwen3 Coder 30B A3B Instruct · 30.5B
60.4%
76Learn-by-interact · proprietary
60.2%
77DeepSeek V3.2 · 685.4B
60.0%
78mini-SWE-agent + GPT-5 mini (2025-08-07) (medium reasoning) · proprietary
59.8%
79DeepSWE Preview · 32.8B
58.8%
80mini-SWE-agent + o3 (2025-04-16) · proprietary
58.4%
81Emergent E1 (v2024-12-23) · proprietary
57.2%
82Artemis Agent v2 (2025-09-24) · proprietary
57.0%
83Gru(2024-12-08) · proprietary
57.0%
84SWE-Rizzo · proprietary
56.6%
85devstral-small-2512 · proprietary
56.4%
86mini-SWE-agent + GPT-5 Mini · proprietary
56.2%
87EPAM AI/Run Developer Agent v20241212 + Anthopic Claude 3.5 Sonnet · proprietary
55.4%
88Amazon Q Developer Agent (v20241202-dev) · proprietary
55.0%
89devstral-2512 · proprietary
53.8%
90FrogBoss-32B-2510 · proprietary
53.6%
91mini-SWE-agent + Gemini 2.5 Pro (2025-05-06) · proprietary
53.6%
92Bracket.sh · proprietary
53.2%
93OpenHands + CodeAct v2.1 (claude-3-5-sonnet-20241022) · proprietary
53.0%
94mini-SWE-agent + Claude 3.7 Sonnet (20250219) · proprietary
52.8%
95Google Jules + Gemini 2.0 Flash (v20241212-experimental) · proprietary
52.2%
96Engine Labs (2024-11-25) · proprietary
51.8%
97AutoCodeRover-v2.1 (Claude-3.5-Sonnet-20241022) · proprietary
51.6%
98Agentless-1.5 + Claude-3.5 Sonnet (20241022) · proprietary
50.8%
99Bytedance MarsCode Agent · proprietary
50.0%
100Solver (2024-10-28) · proprietary
50.0%
101nFactorial (2024-11-05) · proprietary
49.2%
102Tools + Claude 3.5 Sonnet (2024-10-22) · proprietary
49.0%
103Composio SWE-Kit (2024-10-25) · proprietary
48.6%
104AppMap Navie v2 · proprietary
47.2%
105Qwen2.5 Coder 32B Instruct · 32.8B
47.0%
106Devstral-Small-2505 · proprietary
46.8%
107Emergent E1 (v2024-10-12) · proprietary
46.6%
108AutoCodeRover-v2.0 (Claude-3.5-Sonnet-20241022) · proprietary
46.2%
109PatchPilot + Co-PatcheR · proprietary
46.0%
110Solver (2024-09-12) · proprietary
45.4%
111Gru(2024-08-24) · proprietary
45.2%
112FrogMini-14B-2510 · proprietary
45.0%
113mini-SWE-agent + o4-mini (2025-04-16) · proprietary
45.0%
114CodeShellAgent + Gemini 2.0 Flash (Experimental) · proprietary
44.2%
115Agentless Lite + O3 Mini (20250214) · proprietary
42.4%
116Amazon Nova Premier 1.0 (2025-04-30) · proprietary
42.4%
117DeepSeek v3 0324 · 684.5B
42.0%
118nFactorial (2024-10-30) · proprietary
41.6%
119ugaiforge · proprietary
41.6%
120SWE-RL (Llama3-SWE-RL-70B + Agentless Mini) (20250226) · proprietary
41.2%
121Composio SWEkit + Claude 3.5 Sonnet (2024-10-16) · proprietary
40.6%
122Honeycomb · proprietary
40.6%
123Nebius AI Qwen 2.5 72B Generator + LLama 3.1 70B Critic · proprietary
40.6%
124Tools + Claude 3.5 Haiku · proprietary
40.6%
125Qwen 2.5 · proprietary
40.2%
126EPAM AI/Run Developer Agent v20241029 + Anthopic Claude 3.5 Sonnet · proprietary
39.6%
127mini-SWE-agent + GPT-4.1 (2025-04-14) · proprietary
39.6%
128Agentless-1.5 + GPT 4o (2024-05-13) · proprietary
38.8%
129Amazon Q Developer Agent (v20240719-dev) · proprietary
38.8%
130AutoCodeRover (v20240620) + GPT 4o (2024-05-13) · proprietary
38.4%
131devstral-small-2507 · proprietary
38.0%
132Factory Code Droid · proprietary
37.0%
133mini-SWE-agent + GPT-5 nano (2025-08-07) (medium reasoning) · proprietary
34.8%
134SWE-agent + Claude 3.5 Sonnet · proprietary
33.6%
135MASAI + GPT 4o (2024-06-12) · proprietary
32.6%
136Artemis Agent v1 (2024-11-20) · proprietary
32.0%
137nFactorial (2024-10-07) · proprietary
31.6%
138SWE-Fixer (Qwen2.5-7b retriever + Qwen2.5-72b editor) 20241128 · proprietary
30.2%
139Lingma Agent + Lingma SWE-GPT 72b (v0925) · proprietary
28.8%
140mini-SWE-agent + Gemini 2.5 Flash (2025-04-17) · proprietary
28.7%
141EPAM AI/Run Developer Agent + GPT4o · proprietary
27.0%
142AppMap Navie + GPT 4o (2024-05-13) · proprietary
26.2%
143GPT OSS 120B · 120.4B
26.0%
144nFactorial (2024-10-01) · proprietary
25.8%
145Amazon Q Developer Agent (v20240430-dev) · proprietary
25.6%
146Lingma Agent + Lingma SWE-GPT 72b (v0918) · proprietary
25.0%
147mini-SWE-agent + GPT-4.1-mini (2025-04-14) · proprietary
23.9%
148MCTS-Refine-7B · proprietary
23.2%
149SWE-agent + GPT 4o (2024-05-13) · proprietary
23.2%
150SWE-agent + GPT 4 (1106) · proprietary
22.4%
151mini-SWE-agent + GPT-4o (2024-11-20) · proprietary
21.6%
152mini-SWE-agent + Llama 4 Maverick Instruct · proprietary
21.0%
153Lingma Agent + Lingma SWE-GPT 7b (v0925) · proprietary
18.2%
154SWE-agent + Claude 3 Opus · proprietary
15.8%
155mini-SWE-agent + Gemini 2.0 flash · proprietary
13.5%
156Lingma Agent + Lingma SWE-GPT 7b (v0918) · proprietary
10.2%
157mini-SWE-agent + Llama 4 Scout Instruct · proprietary
9.1%
158RAG + Claude 3 Opus · proprietary
7.0%
159RAG + Claude 2 · proprietary
4.4%
160RAG + GPT 4 (1106) · proprietary
2.8%
161RAG + SWE-Llama 7B · proprietary
1.4%
162RAG + SWE-Llama 13B · proprietary
1.2%
163RAG + ChatGPT 3.5 · proprietary
0.4%

Score vs model size

Which models give the most quality for their size — the ones worth running locally.

100B1Tmodel size (log scale) →71.2%26.0%Kimi K2 Instruct · 1T · 65.4%GLM 4.5 · 358B · 64.2%Kimi K2 Thinking · 1.1T · 63.4%DeepSeek V3.2 · 685B · 60.0%DeepSWE Preview · 33B · 58.8%Qwen2.5 Coder 32B Instruct · 33B · 47.0%DeepSeek v3 0324 · 685B · 42.0%GPT OSS 120B · 120B · 26.0%Qwen3 Coder 30B A3B Instruct · 31B · 60.4%Qwen3 Coder 30B A3B I…MiniMax M2 · 229B · 61.0%MiniMax M2GLM 4.6 · 357B · 68.2%GLM 4.6Qwen3 Coder 480B A35B Instruct · 480B · 69.6%Qwen3 Coder 480B A35B…Kimi K2 Instruct 0905 · 1T · 71.2%Kimi K2 Instruct 0905
Each dot is a model. Up = higher score, left = smaller (easier to run locally). The dashed line marks the efficiency frontier — the best score you can get at each size or smaller.
  • Qwen3 Coder 30B A3B Instruct, 31B, score 60.4% — on the efficiency frontier (best score at its size or smaller).
  • MiniMax M2, 229B, score 61.0% — on the efficiency frontier (best score at its size or smaller).
  • GLM 4.6, 357B, score 68.2% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3 Coder 480B A35B Instruct, 480B, score 69.6% — on the efficiency frontier (best score at its size or smaller).
  • Kimi K2 Instruct 0905, 1T, score 71.2% — on the efficiency frontier (best score at its size or smaller).

SWE-bench Verified: frequently asked questions

What is the best open LLM on SWE-bench Verified?
Kimi K2 Instruct 0905 is the top open model on SWE-bench Verified, scoring 71.2%. Among all models tested — including proprietary ones — it ranks #32. The top model overall is live-SWE-agent + Claude 4.5 Opus medium (20251101) at 79.2%.
What's the best SWE-bench Verified model you can run on a 24 GB GPU?
Qwen3 Coder 30B A3B Instruct is the highest-scoring open model that fits in 24 GB at 4-bit quantization (about 17 GB), scoring 60.4% on SWE-bench Verified.
Can open models match proprietary models on SWE-bench Verified?
Not quite on SWE-bench Verified: the strongest proprietary model (live-SWE-agent + Claude 4.5 Opus medium (20251101)) scores 79.2%, ahead of the best open model (Kimi K2 Instruct 0905) at 71.2% — but you can run the open one yourself.

Scores aggregated from swebench. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.