llmrun Composite Score · Reasoning
The best LLMs for reasoning, open and proprietary together, on one open-ended scale where 100 is the average model (reasoning). Switch to open models to see only what you can download and run.
40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the Composite Score is built
| # | Model | llmrun Composite Score | Coding | Agents | Math | Science | Reasoning | Benchmarks | VRAM |
|---|---|---|---|---|---|---|---|---|---|
| 121 | Qwen3.6 Flash10 benchmarks | – | – | 108 | – | 104 | 10 | – | |
| 122 | O1 (Dec 17, 2024)8 benchmarks | – | – | 104 | – | 103 | 8 | – | |
| 123 | Gemini 2.5 Flash9 benchmarks | – | 94 | – | – | 103 | 9 | – | |
| 124 | Codex Mini (May 16, 2025)2 benchmarks | — | – | – | – | – | 102 | 2 | – |
| 125 | Mistral Medium 26049 benchmarks | 102 | – | – | 101 | 102 | 9 | – | |
| 126 | Gemma 4 26B A4B ITopen16.5 GB · 9 benchmarks | 104 | – | – | 102 | 101 | 9 | 16.5 GB | |
| 127 | GPT 5.4 2026 03.056 benchmarks | 118 | – | – | – | 101 | 6 | – | |
| 128 | DeepSeek R1 0528open412 GB · 11 benchmarks | 107 | – | 104 | – | 100 | 11 | 412 GB | |
| 129 | O3 Mini (Jan 31, 2025)18 benchmarks | 103 | – | 106 | 105 | 99 | 18 | – | |
| 130 | Qwen3 235B A22Bopen143 GB · 10 benchmarks | 101 | – | – | – | 99 | 10 | 143 GB | |
| 131 | O1 Preview (Sep 12, 2024)6 benchmarks | – | – | 91 | – | 99 | 6 | – | |
| 132 | Qwen3 235B A22B Instruct 2507open143 GB · 8 benchmarks | 102 | – | – | – | 98 | 8 | 143 GB | |
| 133 | Qwen3.5 9Bopen6.6 GB · 9 benchmarks | – | – | – | 104 | 97 | 9 | 6.6 GB | |
| 134 | Grok 3 Mini2 benchmarks | — | – | – | – | – | 97 | 2 | – |
| 135 | GPT OSS 120Bopen70.8 GB · 20 benchmarks | 98 | 82 | – | 103 | 97 | 20 | 70.8 GB | |
| 136 | Claude 3.5 Sonnet (Oct 22, 2024)11 benchmarks | 99 | 100 | 81 | 88 | 96 | 11 | – | |
| 137 | DeepSeek R1open412 GB · 14 benchmarks | 100 | – | 99 | 99 | 96 | 14 | 412 GB | |
| 138 | GPT 5.4 Mini 2026 03.176 benchmarks | – | – | 89 | – | 96 | 6 | – | |
| 139 | Mistral Small 4 119B 2603open81.6 GB · 3 benchmarks | — | – | – | – | – | 96 | 3 | 81.6 GB |
| 140 | GPT 4.5 Preview (Feb 27, 2025)11 benchmarks | 96 | – | 92 | 98 | 95 | 11 | – | |
| 141 | GPT 5.2 2025 12.116 benchmarks | – | – | – | – | 95 | 6 | – | |
| 142 | GPT 5.4 Nano 2026 03.176 benchmarks | – | – | 95 | – | 94 | 6 | – | |
| 143 | Qwen3 30B A3B Thinking 2507open19.4 GB · 8 benchmarks | – | – | – | 99 | 94 | 8 | 19.4 GB | |
| 144 | GPT 5.1 2025 11.137 benchmarks | – | – | – | 96 | 93 | 7 | – | |
| 145 | Qwen3 30B A3B Instruct 2507open19.4 GB · 5 benchmarks | – | – | – | – | 92 | 5 | 19.4 GB | |
| 146 | Mistral Medium 25086 benchmarks | 92 | – | – | 93 | 92 | 6 | – | |
| 147 | GPT 4.1 (Apr 14, 2025)17 benchmarks | 99 | – | 93 | 96 | 92 | 17 | – | |
| 148 | Grok 34 benchmarks | – | – | – | – | 92 | 4 | – | |
| 149 | Claude 3.5 Sonnet (Jun 20, 2024)7 benchmarks | – | – | 79 | – | 92 | 7 | – | |
| 150 | GPT 4.1 Mini (Apr 14, 2025)16 benchmarks | 92 | – | 95 | 97 | 91 | 16 | – | |
| 151 | Qwen3 32Bopen22.6 GB · 9 benchmarks | 93 | – | – | 96 | 91 | 9 | 22.6 GB | |
| 152 | GPT OSS 20Bopen13.1 GB · 11 benchmarks | 101 | – | – | 92 | 91 | 11 | 13.1 GB | |
| 153 | GPT 5 Nano (Aug 07, 2025)15 benchmarks | 102 | – | 108 | – | 90 | 15 | – | |
| 154 | Kimi K2 Instructopen617 GB · 10 benchmarks | 102 | 102 | – | – | 90 | 10 | 617 GB | |
| 155 | Magistral Medium 25062 benchmarks | — | – | – | – | – | 89 | 2 | – |
| 156 | Mistral Large 3 675B Instruct 2512open454 GB · 5 benchmarks | 93 | – | – | 96 | 89 | 5 | 454 GB | |
| 157 | Magistral Small 2506open17.8 GB · 4 benchmarks | – | – | – | – | 88 | 4 | 17.8 GB | |
| 158 | GPT 4o (May 13, 2024)7 benchmarks | – | – | 79 | – | 88 | 7 | – | |
| 159 | Qwen3 14Bopen11.9 GB · 8 benchmarks | – | – | – | 94 | 88 | 8 | 11.9 GB | |
| 160 | DeepSeek v3 0324open412 GB · 13 benchmarks | 99 | – | 91 | 97 | 88 | 13 | 412 GB | |
| 161 | GPT 4o (Nov 20, 2024)10 benchmarks | 82 | – | 78 | 82 | 88 | 10 | – | |
| 162 | Gemini 2.0 Flash 0017 benchmarks | – | – | 91 | – | 87 | 7 | – | |
| 163 | Grok 2 (Dec 12)6 benchmarks | – | – | 83 | – | 87 | 6 | – | |
| 164 | Gemini 2.5 Flash Lite Preview Thinking (Jun 17)5 benchmarks | 95 | – | – | – | 87 | 5 | – | |
| 165 | GPT 4 (Jun 13)9 benchmarks | – | – | 68 | – | 87 | 9 | – | |
| 166 | GPT 4 Turbo (Apr 09, 2024)8 benchmarks | – | – | 77 | – | 87 | 8 | – | |
| 167 | DeepSeek Chat6 benchmarks | – | – | – | – | 86 | 6 | – | |
| 168 | Qwen2.5 72B Instructopen49.3 GB · 9 benchmarks | – | – | 82 | – | 86 | 9 | 49.3 GB | |
| 169 | Llama 4 Maverick 17B 128E Instructopen273 GB · 17 benchmarks | 81 | – | 87 | 96 | 85 | 17 | 273 GB | |
| 170 | Llama 3.1 405B Instructopen276 GB · 8 benchmarks | – | – | 79 | – | 85 | 8 | 276 GB | |
| 171 | Magistral Small 2509open18.1 GB · 6 benchmarks | – | – | – | 83 | 85 | 6 | 18.1 GB | |
| 172 | O1 Mini (Sep 12, 2024)6 benchmarks | – | – | 95 | – | 85 | 6 | – | |
| 173 | Claude 3 Opus (Feb 29, 2024)10 benchmarks | – | – | 74 | – | 84 | 10 | – | |
| 174 | Mistral Large Instruct 2411open79.8 GB · 6 benchmarks | – | – | 79 | – | 84 | 6 | 79.8 GB | |
| 175 | GPT 4 Turbo2 benchmarks | — | – | – | – | – | 84 | 2 | – |
| 176 | C4ai Command A 03 2025open78.7 GB · 3 benchmarks | — | – | – | – | – | 83 | 3 | 78.7 GB |
| 177 | Qwen3 30B A3Bopen19.4 GB · 7 benchmarks | – | – | – | – | 83 | 7 | 19.4 GB | |
| 178 | Llama 3.1 70B Instructopen51.3 GB · 8 benchmarks | – | – | 74 | – | 83 | 8 | 51.3 GB | |
| 179 | Mistral Large Instruct 2407open86.4 GB · 7 benchmarks | – | – | 77 | – | 83 | 7 | 86.4 GB | |
| 180 | Mistral Small 3.2 24B Instruct 2506open18.1 GB · 6 benchmarks | – | – | – | 82 | 83 | 6 | 18.1 GB | |
| 181 | Gemini 1.5 Pro 0029 benchmarks | – | – | 87 | 89 | 83 | 9 | – | |
| 182 | Llama 3.3 70B Instructopen51.3 GB · 13 benchmarks | 75 | – | 76 | 81 | 82 | 13 | 51.3 GB | |
| 183 | Mistral Small 3.1 24B Instruct 2503open18.1 GB · 7 benchmarks | – | – | 77 | 81 | 82 | 7 | 18.1 GB | |
| 184 | DeepSeek v3open412 GB · 10 benchmarks | 97 | – | 84 | 89 | 81 | 10 | 412 GB | |
| 185 | Qwen3 8Bopen7.6 GB · 8 benchmarks | – | – | – | 88 | 81 | 8 | 7.6 GB | |
| 186 | Gemini 1.5 Pro 0015 benchmarks | – | – | 76 | – | 80 | 5 | – | |
| 187 | Llama 4 Scout 17B 16E Instructopen77.0 GB · 12 benchmarks | – | – | 82 | 83 | 80 | 12 | 77.0 GB | |
| 188 | GPT 4o (Aug 06, 2024)8 benchmarks | – | – | 79 | – | 78 | 8 | – | |
| 189 | Mixtral 8x22B Instruct v0.1open88.4 GB · 6 benchmarks | – | – | – | – | 76 | 6 | 88.4 GB | |
| 190 | C4ai Command R Plus 08 2024open73.8 GB · 3 benchmarks | — | – | – | – | – | 74 | 3 | 73.8 GB |
| 191 | Gemma 3 27B ITopen21.7 GB · 11 benchmarks | 69 | – | 87 | 80 | 74 | 11 | 21.7 GB | |
| 192 | GPT 4o Mini (Jul 18, 2024)14 benchmarks | 68 | – | 79 | – | 72 | 14 | – | |
| 193 | GPT 4.1 Nano (Apr 14, 2025)13 benchmarks | 75 | – | 88 | 82 | 72 | 13 | – | |
| 194 | Ministral 3B 24104 benchmarks | – | – | – | – | 71 | 4 | – | |
| 195 | Llama 3.1 8B Instructopen7.9 GB · 11 benchmarks | 56 | – | 68 | 55 | 69 | 11 | 7.9 GB | |
| 196 | Mixtral 8x7B Instruct v0.1open30.5 GB · 5 benchmarks | – | – | – | – | 69 | 5 | 30.5 GB | |
| 197 | Gemma 3 4B ITopen5.0 GB · 6 benchmarks | – | – | – | – | 68 | 6 | 5.0 GB | |
| 198 | Gemini 1.5 Flash 0015 benchmarks | – | – | 69 | – | 68 | 5 | – | |
| 199 | Claude 2.15 benchmarks | – | – | – | – | 68 | 5 | – | |
| 200 | Gemma 3 12B ITopen10.9 GB · 8 benchmarks | – | – | – | 72 | 66 | 8 | 10.9 GB | |
| 201 | Gemma 2 27B2 benchmarks | — | – | – | – | – | 66 | 2 | – |
| 202 | Qwen2.5 7B Instructopen5.8 GB · 6 benchmarks | – | – | – | – | 65 | 6 | 5.8 GB | |
| 203 | Claude 3 Haiku (Mar 07, 2024)7 benchmarks | – | – | 64 | – | 65 | 7 | – | |
| 204 | C4ai Command R 08 2024open25.1 GB · 2 benchmarks | — | – | – | – | – | 64 | 2 | 25.1 GB |
| 205 | Meta Llama 3 8B Instructopen7.9 GB · 7 benchmarks | – | – | 59 | – | 64 | 7 | 7.9 GB | |
| 206 | Llama 2 13B Chat HFopen11.5 GB · 2 benchmarks | — | – | – | – | – | 57 | 2 | 11.5 GB |
| 207 | GPT 3.5 Turbo (Jan 25)10 benchmarks | – | – | 62 | – | 57 | 10 | – | |
| 208 | Llama 2 70B Chat HFopen50.2 GB · 5 benchmarks | – | – | 56 | – | 45 | 5 | 50.2 GB |
The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.
Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.
VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus room for a 16K-token context. Longer contexts need more memory. Proprietary models can't run locally, so the VRAM filter hides them.
How the llmrun Composite Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.