Coding
CursorBench Leaderboard
CursorBench, from Cursor (Anysphere), measures agentic coding on tasks drawn from real Cursor engineering sessions rather than synthetic puzzles. Each model is run at several reasoning-effort levels, and Epoch AI reports the correctness score.
Source: epoch2 open models ranked+57 proprietaryData through Sep 2026
All models ranked on CursorBench
Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.
| # | Model | Score |
|---|---|---|
| 1 | Claude Opus 5.5 Max · proprietary | 57.8% |
| 2 | Claude Opus 5.5 (high) · proprietary | 56.0% |
| 3 | Claude Opus 5.5 (xhigh) · proprietary | 56.0% |
| 4 | Claude Sonnet 5.5 Max · proprietary | 55.5% |
| 5 | Claude Sonnet 5.5 (xhigh) · proprietary | 53.1% |
| 6 | Claude Opus 5.5 (medium) · proprietary | 52.5% |
| 7 | Claude Fable 5.1 Max · proprietary | 51.8% |
| 8 | Claude Fable 5.1 (xhigh) · proprietary | 51.6% |
| 9 | Claude Fable 5.1 (high) · proprietary | 49.2% |
| 10 | Claude Sonnet 5.5 (high) · proprietary | 47.8% |
| 11 | Claude Fable 5.1 (medium) · proprietary | 46.8% |
| 12 | Claude Opus 5 Max · proprietary | 46.6% |
| 13 | Grok 4.7 (xhigh) · proprietary | 46.3% |
| 14 | Claude Opus 5 (xhigh) · proprietary | 46.1% |
| 15 | Claude Fable 5.1 (low) · proprietary | 45.1% |
| 16 | Claude Opus 5 (high) · proprietary | 44.7% |
| 17 | Grok 4.7 (high) · proprietary | 43.9% |
| 18 | Claude Opus 5.5 (low) · proprietary | 43.7% |
| 19 | Claude Opus 5 (medium) · proprietary | 43.3% |
| 20 | GLM 5.3 · 753.3B | 42.6% |
| 21 | GPT 5.6 Sol Max · proprietary | 41.7% |
| 22 | Grok 4.7 (medium) · proprietary | 41.6% |
| 23 | Muse Spark 1.3 Max · proprietary | 41.6% |
| 24 | Grok 4.6 (xhigh) · proprietary | 41.4% |
| 25 | GPT 5.6 Terra Max · proprietary | 41.3% |
| 26 | Claude Opus 5 (low) · proprietary | 40.7% |
| 27 | Grok 4.6 (high) · proprietary | 40.4% |
| 28 | Gemini 3.8 Flash (high) · proprietary | 39.6% |
| 29 | Claude Sonnet 5.5 (medium) · proprietary | 39.2% |
| 30 | GPT 5.6 Sol (xhigh) · proprietary | 37.7% |
| 31 | Muse Spark 1.3 (xhigh) · proprietary | 37.5% |
| 32 | Gemini 3.8 Flash (medium) · proprietary | 37.3% |
| 33 | GLM 5.3 Flash · 321.3B | 36.8% |
| 34 | Grok 4.6 (medium) · proprietary | 36.1% |
| 35 | GPT 5.6 Luna Max · proprietary | 35.9% |
| 36 | Claude Sonnet 5.5 (low) · proprietary | 35.8% |
| 37 | GPT 5.6 Sol (high) · proprietary | 35.7% |
| 38 | Claude Sonnet 5 Max · proprietary | 34.1% |
| 39 | GPT 5.6 Terra (xhigh) · proprietary | 33.6% |
| 40 | Grok 4.6 (low) · proprietary | 33.4% |
| 41 | Muse Spark 1.3 (high) · proprietary | 33.4% |
| 42 | Grok 4.7 (low) · proprietary | 33.1% |
| 43 | GPT 5.6 Luna (xhigh) · proprietary | 33.0% |
| 44 | Muse Spark 1.3 (medium) · proprietary | 32.6% |
| 45 | Claude Sonnet 5 (xhigh) · proprietary | 32.0% |
| 46 | GPT 5.6 Sol (medium) · proprietary | 31.1% |
| 47 | Claude Sonnet 5 (high) · proprietary | 30.8% |
| 48 | GPT 5.6 Terra (high) · proprietary | 30.7% |
| 49 | GPT 5.6 Luna (high) · proprietary | 29.4% |
| 50 | Muse Spark 1.3 (low) · proprietary | 29.3% |
| 51 | Claude Sonnet 5 (medium) · proprietary | 28.0% |
| 52 | Composer 2.5 · proprietary | 27.7% |
| 53 | GPT 5.6 Terra (medium) · proprietary | 27.6% |
| 54 | GPT 5.6 Terra (low) · proprietary | 25.2% |
| 55 | GPT 5.6 Sol (low) · proprietary | 24.6% |
| 56 | Muse Spark 1.3 (minimal) · proprietary | 24.3% |
| 57 | Claude Sonnet 5 (low) · proprietary | 24.1% |
| 58 | GPT 5.6 Luna (medium) · proprietary | 22.2% |
| 59 | GPT 5.6 Luna (low) · proprietary | 16.0% |
CursorBench: frequently asked questions
- What is the best open LLM on CursorBench?
- GLM 5.3 is the top open model on CursorBench, scoring 42.6%. Among all models tested — including proprietary ones — it ranks #20. The top model overall is Claude Opus 5.5 Max (Anthropic) at 57.8%.
- Can open models match proprietary models on CursorBench?
- Not quite on CursorBench: the strongest proprietary model (Claude Opus 5.5 Max) scores 57.8%, ahead of the best open model (GLM 5.3) at 42.6% — but you can run the open one yourself.
Scores aggregated from epoch. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.