Coding

CursorBench Leaderboard

CursorBench, from Cursor (Anysphere), measures agentic coding on tasks drawn from real Cursor engineering sessions rather than synthetic puzzles. Each model is run at several reasoning-effort levels, and Epoch AI reports the correctness score.

Source: epoch2 open models ranked+57 proprietaryData through Sep 2026

All models ranked on CursorBench

Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.

#ModelScore
1Claude Opus 5.5 Max · proprietary
57.8%
2Claude Opus 5.5 (high) · proprietary
56.0%
3Claude Opus 5.5 (xhigh) · proprietary
56.0%
4Claude Sonnet 5.5 Max · proprietary
55.5%
5Claude Sonnet 5.5 (xhigh) · proprietary
53.1%
6Claude Opus 5.5 (medium) · proprietary
52.5%
7Claude Fable 5.1 Max · proprietary
51.8%
8Claude Fable 5.1 (xhigh) · proprietary
51.6%
9Claude Fable 5.1 (high) · proprietary
49.2%
10Claude Sonnet 5.5 (high) · proprietary
47.8%
11Claude Fable 5.1 (medium) · proprietary
46.8%
12Claude Opus 5 Max · proprietary
46.6%
13Grok 4.7 (xhigh) · proprietary
46.3%
14Claude Opus 5 (xhigh) · proprietary
46.1%
15Claude Fable 5.1 (low) · proprietary
45.1%
16Claude Opus 5 (high) · proprietary
44.7%
17Grok 4.7 (high) · proprietary
43.9%
18Claude Opus 5.5 (low) · proprietary
43.7%
19Claude Opus 5 (medium) · proprietary
43.3%
20GLM 5.3 · 753.3B
42.6%
21GPT 5.6 Sol Max · proprietary
41.7%
22Grok 4.7 (medium) · proprietary
41.6%
23Muse Spark 1.3 Max · proprietary
41.6%
24Grok 4.6 (xhigh) · proprietary
41.4%
25GPT 5.6 Terra Max · proprietary
41.3%
26Claude Opus 5 (low) · proprietary
40.7%
27Grok 4.6 (high) · proprietary
40.4%
28Gemini 3.8 Flash (high) · proprietary
39.6%
29Claude Sonnet 5.5 (medium) · proprietary
39.2%
30GPT 5.6 Sol (xhigh) · proprietary
37.7%
31Muse Spark 1.3 (xhigh) · proprietary
37.5%
32Gemini 3.8 Flash (medium) · proprietary
37.3%
33GLM 5.3 Flash · 321.3B
36.8%
34Grok 4.6 (medium) · proprietary
36.1%
35GPT 5.6 Luna Max · proprietary
35.9%
36Claude Sonnet 5.5 (low) · proprietary
35.8%
37GPT 5.6 Sol (high) · proprietary
35.7%
38Claude Sonnet 5 Max · proprietary
34.1%
39GPT 5.6 Terra (xhigh) · proprietary
33.6%
40Grok 4.6 (low) · proprietary
33.4%
41Muse Spark 1.3 (high) · proprietary
33.4%
42Grok 4.7 (low) · proprietary
33.1%
43GPT 5.6 Luna (xhigh) · proprietary
33.0%
44Muse Spark 1.3 (medium) · proprietary
32.6%
45Claude Sonnet 5 (xhigh) · proprietary
32.0%
46GPT 5.6 Sol (medium) · proprietary
31.1%
47Claude Sonnet 5 (high) · proprietary
30.8%
48GPT 5.6 Terra (high) · proprietary
30.7%
49GPT 5.6 Luna (high) · proprietary
29.4%
50Muse Spark 1.3 (low) · proprietary
29.3%
51Claude Sonnet 5 (medium) · proprietary
28.0%
52Composer 2.5 · proprietary
27.7%
53GPT 5.6 Terra (medium) · proprietary
27.6%
54GPT 5.6 Terra (low) · proprietary
25.2%
55GPT 5.6 Sol (low) · proprietary
24.6%
56Muse Spark 1.3 (minimal) · proprietary
24.3%
57Claude Sonnet 5 (low) · proprietary
24.1%
58GPT 5.6 Luna (medium) · proprietary
22.2%
59GPT 5.6 Luna (low) · proprietary
16.0%

CursorBench: frequently asked questions

What is the best open LLM on CursorBench?
GLM 5.3 is the top open model on CursorBench, scoring 42.6%. Among all models tested — including proprietary ones — it ranks #20. The top model overall is Claude Opus 5.5 Max (Anthropic) at 57.8%.
Can open models match proprietary models on CursorBench?
Not quite on CursorBench: the strongest proprietary model (Claude Opus 5.5 Max) scores 57.8%, ahead of the best open model (GLM 5.3) at 42.6% — but you can run the open one yourself.

Scores aggregated from epoch. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.