Best LLMs for agents: open and proprietary

Open and proprietary models together on one 0–100 scale (agentic tool use). Switch to local models to see only what you can download and run.

40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the score is built

Models ranked by agents llmrun Score
#Modelllmrun ScoreCodingAgentsMathScienceReasoningBenchmarksVRAM
1GPT 6 Astra6 benchmarks–87––746–
2Claude Opus 4.77 benchmarks6875––547–
3Claude Opus 5 Max22 benchmarks787291557522–
4GPT 6 Astra Max19 benchmarks837296578619–
5Grok 4.65 benchmarks–72–––5–
6GPT 5.6 Sol Max21 benchmarks787091577721–
7GLM 5.3open456 GB · 21 benchmarks676872495821456 GB
8GPT 5.6 Terra Max20 benchmarks736787557120–
9Claude Opus 4.68 benchmarks6464–––8–
10Claude Opus 4.85 benchmarks–64––565–
11GLM 5.3 Flashopen195 GB · 17 benchmarks526362443717195 GB
12GPT 5.6 Luna Max20 benchmarks696382486220–
13Claude Sonnet 55 benchmarks–62–––5–
14Claude Fable 5 Max20 benchmarks786294547420–
15Kimi K3open1674 GB · 26 benchmarks7361815263261674 GB
16GLM 5.2open456 GB · 24 benchmarks586068475224456 GB
17Muse Spark 1.19 benchmarks66596948–9–
18GPT 5.4 (Mar 05, 2026)20 benchmarks695778516720–
19Gemini 3 Pro Preview17 benchmarks625560465417–
20Claude Opus 4.8 Max19 benchmarks645582486619–
21GLM 5.1open457 GB · 13 benchmarks535457404613457 GB
22Claude Opus 4.5 (Nov 01, 2025)9 benchmarks–52––559–
23Grok 4.2011 benchmarks5549––6311–
24GPT 5.2 Codex8 benchmarks6248–––8–
25Kimi K2.7 Codeopen620 GB · 19 benchmarks534661405019620 GB
26GLM 5open457 GB · 15 benchmarks4945––4015457 GB
27Gemini 3 Pro Preview (2025-11-18)2 benchmarks—–44–––2–
28Claude Sonnet 4.68 benchmarks–43––608–
29Claude Sonnet 4.5 (Sep 29, 2025)11 benchmarks–42–324611–
30Claude 4.5 Sonnet (20250929)2 benchmarks—–41–––2–
31Gemini 3 Pro3 benchmarks—–40–––3–
32MiniMax M3open257 GB · 19 benchmarks524046413819257 GB
33Claude 4 Opus (20250514)2 benchmarks—–38–––2–
34Kimi K2.5open620 GB · 20 benchmarks4937–404520620 GB
35MiniMax M2.5open138 GB · 11 benchmarks4737––4511138 GB
36Claude 4 Sonnet (20250514)2 benchmarks—–36–––2–
37DeepSeek V3.2open415 GB · 13 benchmarks3536––4313415 GB
38Kimi K2 Thinkingopen620 GB · 9 benchmarks4334–––9620 GB
39GLM 4.7open216 GB · 13 benchmarks413251363513216 GB
40GLM 4.5open216 GB · 7 benchmarks3832–––7216 GB
41o3 (2025-04-16)2 benchmarks—–32–––2–
42Qwen3 Coder 480B A35B Instructopen289 GB · 6 benchmarks—4031–––6289 GB
43MiniMax M2open138 GB · 5 benchmarks–31–––5138 GB
44GLM 4.6open215 GB · 6 benchmarks3631–29–6215 GB
45Grok 4 (Jul 09)12 benchmarks4930––4812–
46Gemini 2.5 Pro13 benchmarks–2949374313–
47Gemini 2.5 Pro (2025-05-06)2 benchmarks—–28–––2–
48Kimi K2 Instructopen620 GB · 10 benchmarks4128––2510620 GB
49Claude 3.7 Sonnet (20250219)2 benchmarks—–28–––2–
50Claude 3.5 Sonnet (Oct 22, 2024)11 benchmarks382623212911–
51o4-mini (2025-04-16)2 benchmarks—–23–––2–
52Gemini 2.5 Flash9 benchmarks–22––349–
53Gemini 2.5 Flash (2025-04-17)2 benchmarks—–15–––2–
54Qwen2.5 Coder 32B Instructopen20.5 GB · 3 benchmarks—–15–––320.5 GB
55GPT OSS 120Bopen70.5 GB · 20 benchmarks3714–31302070.5 GB
56Llama 4 Maverick Instruct2 benchmarks—–11–––2–
57Llama 4 Scout Instruct2 benchmarks—–7–––2–

The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.

Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.

VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus a working context. Proprietary models can't run locally, so the VRAM filter hides them.

How the llmrun Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.