Coding
LMArena WebDev Leaderboard
Code Arena (formerly WebDev Arena) is Arena's head-to-head coding leaderboard: two models each build a real web app or UI from the same prompt, and people vote blind on which result is better. The rating shown is a relative Bradley-Terry score, not a percentage — compare it only to other models on this board.
Source: lmarena48 open models ranked+75 proprietaryData through Sep 2026
All models ranked on LMArena WebDev
Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.
| # | Model | Score |
|---|---|---|
| 1 | GPT 6 Astra Max · proprietary | 1793.2 |
| 2 | Claude Fable 5.1 Max · proprietary | 1754.9 |
| 3 | Claude Opus 5 Max · proprietary | 1691.1 |
| 4 | Qwen3.8 Max · proprietary | 1670.9 |
| 5 | Qwen3.8 Max (Sep 02) · proprietary | 1662.2 |
| 6 | Claude Opus 5 High · proprietary | 1661.3 |
| 7 | Kimi K3 · 2779.9B | 1657.9 |
| 8 | Muse Spark 1.3 Max · proprietary | 1656.7 |
| 9 | Qwen3.8 Flash Next · 180.0B | 1635.6 |
| 10 | Grok 4.7 Xhigh · proprietary | 1632.5 |
| 11 | Hy4 Preview · 780.0B | 1627.4 |
| 12 | Claude Fable 5 High · proprietary | 1626.8 |
| 13 | Muse Spark 1.3 (xHigh) · proprietary | 1623.7 |
| 14 | GLM 5.3 · 753.3B | 1619.7 |
| 15 | GPT 5.6 Sol Xhigh (codex Harness) · proprietary | 1617.3 |
| 16 | Grok 4.6 High · proprietary | 1616.2 |
| 17 | DeepSeek V4.1 Flash · 763.2B | 1616.1 |
| 18 | GLM 5.3 Flash · 321.3B | 1612.2 |
| 19 | GLM 5.2 · 753.3B | 1598.2 |
| 20 | Gemini 3.7 Flash High · proprietary | 1595.0 |
| 21 | Qwen3.8 27B · 27.8B | 1591.2 |
| 22 | Gemini 3.8 Flash High · proprietary | 1583.4 |
| 23 | DeepSeek V4 Pro 0813 · 1650.5B | 1580.2 |
| 24 | DeepSeek V4 Flash · 290.9B | 1579.9 |
| 25 | Claude Opus 4.7 · proprietary | 1557.5 |
| 26 | Claude Opus 4.8 High · proprietary | 1556.1 |
| 27 | Claude Opus 4.7 High · proprietary | 1555.6 |
| 28 | Grok 4.5 · proprietary | 1552.4 |
| 29 | Claude Opus 4.6 High · proprietary | 1546.6 |
| 30 | Muse Spark 1.1 · proprietary | 1541.9 |
| 31 | Claude Sonnet 5 High · proprietary | 1537.8 |
| 32 | Claude Opus 4.8 · proprietary | 1537.2 |
| 33 | Claude Opus 4.6 · proprietary | 1537.1 |
| 34 | Gemini 3.6 Flash High · proprietary | 1536.8 |
| 35 | Muse Spark 1.2 (xHigh) · proprietary | 1534.4 |
| 36 | Claude Sonnet 4.6 · proprietary | 1520.5 |
| 37 | GPT 5.6 Luna Xhigh (codex Harness) · proprietary | 1519.8 |
| 38 | Seed 2.1 Pro Preview · proprietary | 1519.2 |
| 39 | GPT 5.6 Terra Xhigh (codex Harness) · proprietary | 1518.1 |
| 40 | Qwen3.7 Max (May 17, 2026) · proprietary | 1517.1 |
| 41 | GPT 5.5 Xhigh (codex Harness) · proprietary | 1510.2 |
| 42 | Hy3 · 298.8B | 1508.7 |
| 43 | Kimi K2.6 · 1026.9B | 1508.6 |
| 44 | GLM 5.1 · 753.9B | 1508.1 |
| 45 | Gemini 3.5 Flash High · proprietary | 1500.0 |
| 46 | Claude Opus 4.5 High 32K (Nov 01, 2025) · proprietary | 1494.9 |
| 47 | Gemini 3.5 Flash Medium · proprietary | 1491.0 |
| 48 | GPT 5.5 High (codex Harness) · proprietary | 1486.6 |
| 49 | MiniMax M3 · 427.0B | 1485.0 |
| 50 | Qwen3.6 Max Preview · proprietary | 1478.8 |
| 51 | MiMo V2.5 Pro · 1023.2B | 1476.8 |
| 52 | Kimi K2.7 Code · 1026.9B | 1472.3 |
| 53 | Claude Opus 4.5 (Nov 01, 2025) · proprietary | 1468.3 |
| 54 | DeepSeek V4 Pro · 1598.8B | 1463.5 |
| 55 | GPT 5.4 High (codex Harness) · proprietary | 1462.5 |
| 56 | Qwen3.6 Plus · proprietary | 1460.5 |
| 57 | GPT 5.5 (codex Harness) · proprietary | 1457.7 |
| 58 | Gemini 3.5 Flash Lite · proprietary | 1446.9 |
| 59 | Gemini 3.1 Pro Preview · proprietary | 1446.7 |
| 60 | GPT 5.4 Medium (codex Harness) · proprietary | 1442.7 |
| 61 | Gemini 3 Pro · proprietary | 1438.9 |
| 62 | Gemini 3 Flash · proprietary | 1438.2 |
| 63 | MiMo V2.5 · 310.8B | 1437.4 |
| 64 | Kimi K2.5 · 1026.9B | 1436.3 |
| 65 | GLM 5 · 753.9B | 1435.8 |
| 66 | GLM 4.7 · 358.3B | 1434.9 |
| 67 | Mimo v2 Pro · proprietary | 1433.7 |
| 68 | GPT 5 Medium · proprietary | 1419.7 |
| 69 | GPT 5.2 · proprietary | 1416.8 |
| 70 | Inkling · 952.4B | 1411.1 |
| 71 | GPT 5.3 Codex (codex Harness) · proprietary | 1409.0 |
| 72 | Inkling Small · 266.0B | 1406.7 |
| 73 | GLM 5v Turbo · proprietary | 1400.6 |
| 74 | Qwen3.5 397B A17B · 403.4B | 1398.8 |
| 75 | MiniMax M2.7 · 228.7B | 1397.5 |
| 76 | GPT 5.4 Mini High · proprietary | 1397.2 |
| 77 | Claude Sonnet 4.5 High 32K (Sep 29, 2025) · proprietary | 1392.8 |
| 78 | GPT 5.1 Medium · proprietary | 1392.1 |
| 79 | GPT 5.4 · proprietary | 1391.8 |
| 80 | Claude Opus 4.1 (Aug 05, 2025) · proprietary | 1389.3 |
| 81 | MiniMax M2.1 · 228.7B | 1387.4 |
| 82 | Claude Sonnet 4.5 (Sep 29, 2025) · proprietary | 1385.4 |
| 83 | MiniMax M2.5 · 228.7B | 1384.0 |
| 84 | Gemini 3 Flash (thinking Minimal) · proprietary | 1383.1 |
| 85 | Grok 4.20 Beta 0309 Reasoning · proprietary | 1373.4 |
| 86 | Solar Pro4 · proprietary | 1364.7 |
| 87 | Gemma 4 31B IT · 31.3B | 1364.2 |
| 88 | Gemma 4 26B A4B IT · 25.8B | 1361.9 |
| 89 | DeepSeek V3.2 · 685.4B | 1360.8 |
| 90 | Muse Glimmer 30B · 29.8B | 1359.8 |
| 91 | Qwen3.5 122B A10B · 125.1B | 1358.2 |
| 92 | Qwen3.5 27B · 27.8B | 1357.8 |
| 93 | Hy3 Preview · 298.8B | 1357.0 |
| 94 | Grok 4.3 · proprietary | 1357.0 |
| 95 | Laguna M.1 · 225.8B | 1347.2 |
| 96 | GPT 5.1 · proprietary | 1341.0 |
| 97 | GLM 4.6 · 356.8B | 1340.8 |
| 98 | GPT 5.2 Codex · proprietary | 1338.7 |
| 99 | GPT 5.1 Codex · proprietary | 1336.2 |
| 100 | MiMo v2 Flash · 309.8B | 1330.7 |
| 101 | Claude Haiku 4.5 (Oct 01, 2025) · proprietary | 1329.5 |
| 102 | Kimi K2 Thinking · 1026.4B | 1323.0 |
| 103 | Laguna XS.2 · 33.4B | 1302.3 |
| 104 | MiniMax M2 · 228.7B | 1298.0 |
| 105 | Qwen3 Coder 480B A35B Instruct · 480.2B | 1273.9 |
| 106 | DeepSeek V3.2 Exp · 685.4B | 1271.8 |
| 107 | Mistral Medium 3.5 128B · 127.7B | 1264.6 |
| 108 | KAT Coder Pro V1 · proprietary | 1255.2 |
| 109 | Gemini 3.1 Flash Lite Preview · proprietary | 1254.5 |
| 110 | Qwen3.5 35B A3B · 36.0B | 1250.3 |
| 111 | GPT 5.1 Codex Mini · proprietary | 1244.1 |
| 112 | Grok 4.1 Fast Reasoning · proprietary | 1240.7 |
| 113 | Qwen3.5 Flash · proprietary | 1239.0 |
| 114 | Trinity Large Thinking · 398.6B | 1236.8 |
| 115 | Mistral Large 3 675B Instruct 2512 · 675B | 1228.8 |
| 116 | Gemini 2.5 Pro · proprietary | 1226.0 |
| 117 | Grok 4.1 Thinking · proprietary | 1211.2 |
| 118 | Devstral 2 123B Instruct 2512 · 125.0B | 1194.2 |
| 119 | Granite 4.1 8B · 8.8B | 1191.6 |
| 120 | Mercury 2 · proprietary | 1167.0 |
| 121 | Grok Code Fast 1 · proprietary | 1165.3 |
| 122 | Grok 4 Fast Reasoning · proprietary | 1161.9 |
| 123 | Devstral Medium 2507 · proprietary | 1081.4 |
Score vs model size
Which models give the most quality for their size — the ones worth running locally.
- Granite 4.1 8B, 9B, score 1191.6 — on the efficiency frontier (best score at its size or smaller).
- Gemma 4 26B A4B IT, 26B, score 1361.9 — on the efficiency frontier (best score at its size or smaller).
- Qwen3.8 27B, 28B, score 1591.2 — on the efficiency frontier (best score at its size or smaller).
- Qwen3.8 Flash Next, 180B, score 1635.6 — on the efficiency frontier (best score at its size or smaller).
- Kimi K3, 2.8T, score 1657.9 — on the efficiency frontier (best score at its size or smaller).
LMArena WebDev: frequently asked questions
- What is the best open LLM on LMArena WebDev?
- Kimi K3 is the top open model on LMArena WebDev, scoring 1657.9. Among all models tested — including proprietary ones — it ranks #7. The top model overall is GPT 6 Astra Max (OpenAI) at 1793.2.
- What's the best LMArena WebDev model you can run on a 24 GB GPU?
- Qwen3.8 27B is the highest-scoring open model that fits in 24 GB at 4-bit quantization (about 15 GB), scoring 1591.2 on LMArena WebDev.
- What's the best LMArena WebDev model you can run on a 12 GB GPU?
- Granite 4.1 8B is the highest-scoring open model that fits in 12 GB at 4-bit quantization (about 5 GB), scoring 1191.6 on LMArena WebDev.
- Can open models match proprietary models on LMArena WebDev?
- Not quite on LMArena WebDev: the strongest proprietary model (GPT 6 Astra Max) scores 1793.2, ahead of the best open model (Kimi K3) at 1657.9 — but you can run the open one yourself.
Scores aggregated from lmarena. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.