llmrun Composite Score · Reasoning
The best LLMs for reasoning, open and proprietary together, on one open-ended scale where 100 is the average model (reasoning). Switch to open models to see only what you can download and run.
40 benchmarks4 sourcesUpdated 3 Oct 2026Reference scale 2026-Q4How the Composite Score is built
| # | Model | llmrun Composite Score | Coding | Agents | Math | Science | Reasoning | Benchmarks | VRAM |
|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT 6 Astra Max19 benchmarks | 156 | 144 | 152 | 142 | 163 | 19 | – | |
| 2 | GPT 6.1 Sol Max13 benchmarks | 127 | – | 153 | 141 | 157 | 13 | – | |
| 3 | Claude Opus 5.5 Max17 benchmarks | 147 | – | 152 | 144 | 154 | 17 | – | |
| 4 | Claude Sonnet 5.5 Max13 benchmarks | 141 | – | 146 | 143 | 151 | 13 | – | |
| 5 | GPT 5.6 Sol Promax6 benchmarks | – | – | – | – | 148 | 6 | – | |
| 6 | GPT 5.6 Sol Max21 benchmarks | 146 | 141 | 143 | 142 | 145 | 21 | – | |
| 7 | Claude Fable 5.1 Max15 benchmarks | 149 | – | 149 | 143 | 143 | 15 | – | |
| 8 | GPT 6 Sol Max18 benchmarks | 149 | – | 147 | 141 | 143 | 18 | – | |
| 9 | Claude Opus 5 Max22 benchmarks | 146 | 144 | 143 | 139 | 143 | 22 | – | |
| 10 | GPT 5.4 Pro (Mar 05, 2026)8 benchmarks | – | – | 136 | 141 | 142 | 8 | – | |
| 11 | GPT 6 Astra6 benchmarks | – | 164 | – | – | 142 | 6 | – | |
| 12 | Claude Opus 5.54 benchmarks | – | – | – | 145 | 141 | 4 | – | |
| 13 | Claude Fable 5 Max20 benchmarks | 147 | 134 | 148 | 138 | 141 | 20 | – | |
| 14 | Claude Fable 5.19 benchmarks | 147 | – | – | 142 | 141 | 9 | – | |
| 15 | Claude Opus 59 benchmarks | 147 | – | – | 139 | 141 | 9 | – | |
| 16 | Claude Fable 56 benchmarks | – | – | – | – | 140 | 6 | – | |
| 17 | GPT 5.59 benchmarks | 141 | – | – | 137 | 139 | 9 | – | |
| 18 | GPT 5.6 Sol9 benchmarks | 142 | – | – | 140 | 139 | 9 | – | |
| 19 | GPT 5.6 Terra Max20 benchmarks | 139 | 138 | 140 | 139 | 138 | 20 | – | |
| 20 | Gemini 3 Deep Think Preview3 benchmarks | — | – | – | – | – | 137 | 3 | – |
| 21 | GPT 5.5 Pro7 benchmarks | – | – | 142 | – | 137 | 7 | – | |
| 22 | Gemini 3.7 Flash15 benchmarks | 118 | – | 130 | 129 | 137 | 15 | – | |
| 23 | Gemini 3.1 Pro Preview8 benchmarks | – | – | – | – | 135 | 8 | – | |
| 24 | GPT 6 Sol4 benchmarks | – | – | – | 139 | 134 | 4 | – | |
| 25 | GPT 5.4 (Mar 05, 2026)20 benchmarks | 134 | 129 | 133 | 134 | 134 | 20 | – | |
| 26 | Claude Opus 4.8 Max19 benchmarks | 127 | 127 | 136 | 129 | 133 | 19 | – | |
| 27 | Gemini 3.5 Flash4 benchmarks | – | – | – | – | 132 | 4 | – | |
| 28 | GPT 5.6 Terra10 benchmarks | 135 | – | – | 136 | 132 | 10 | – | |
| 29 | Gemini 3.8 Flash6 benchmarks | 133 | – | – | 125 | 132 | 6 | – | |
| 30 | DeepSeek V4 Pro 0813open991 GB · 21 benchmarks | 125 | – | 128 | 126 | 131 | 21 | 991 GB | |
| 31 | Claude Opus 4.7 Max15 benchmarks | 131 | – | 130 | 120 | 130 | 15 | – | |
| 32 | Gemini 3.6 Flash16 benchmarks | 113 | – | 124 | 125 | 130 | 16 | – | |
| 33 | Kimi K3open1670 GB · 26 benchmarks | 139 | 133 | 135 | 136 | 129 | 26 | 1670 GB | |
| 34 | Grok 4.79 benchmarks | – | – | 122 | 130 | 129 | 9 | – | |
| 35 | Grok 4.2011 benchmarks | 116 | 122 | – | – | 129 | 11 | – | |
| 36 | DeepSeek V4 Flash 0731open183 GB · 21 benchmarks | 121 | – | 128 | 124 | 129 | 21 | 183 GB | |
| 37 | Qwen3.8 Max10 benchmarks | – | – | 132 | – | 129 | 10 | – | |
| 38 | Muse Spark 1.27 benchmarks | 121 | – | – | 131 | 128 | 7 | – | |
| 39 | GPT 5.6 Luna Max20 benchmarks | 134 | 135 | 135 | 130 | 128 | 20 | – | |
| 40 | GPT 5.2 (Dec 11, 2025)12 benchmarks | – | – | 124 | – | 128 | 12 | – | |
| 41 | Muse Spark 1.3 Max6 benchmarks | – | – | 132 | 138 | 128 | 6 | – | |
| 42 | Grok 4.516 benchmarks | 128 | – | 125 | 128 | 127 | 16 | – | |
| 43 | Claude Sonnet 4.68 benchmarks | – | 116 | – | – | 127 | 8 | – | |
| 44 | GPT 6 Luna Max18 benchmarks | 134 | – | 135 | 128 | 127 | 18 | – | |
| 45 | Claude Sonnet 4.6 Max11 benchmarks | – | – | 128 | 108 | 126 | 11 | – | |
| 46 | GLM 5.3open454 GB · 21 benchmarks | 131 | 140 | 129 | 131 | 126 | 21 | 454 GB | |
| 47 | Qwen3.7 Max17 benchmarks | 121 | – | 126 | 122 | 125 | 17 | – | |
| 48 | GPT 5.6 Luna8 benchmarks | – | – | – | 129 | 125 | 8 | – | |
| 49 | Gemini 3 Flash Preview7 benchmarks | – | – | – | – | 125 | 7 | – | |
| 50 | Claude Sonnet 5 Max13 benchmarks | – | – | 132 | 114 | 125 | 13 | – | |
| 51 | DeepSeek V4.1 Flashopen458 GB · 10 benchmarks | 116 | – | 131 | 124 | 125 | 10 | 458 GB | |
| 52 | Claude Opus 4.85 benchmarks | – | 136 | – | – | 124 | 5 | – | |
| 53 | Claude Opus 4.5 (Nov 01, 2025)9 benchmarks | – | 125 | – | – | 123 | 9 | – | |
| 54 | GPT 6 Luna5 benchmarks | 131 | – | – | 127 | 123 | 5 | – | |
| 55 | Claude Opus 4.6 Max12 benchmarks | – | – | 128 | 124 | 123 | 12 | – | |
| 56 | Claude Opus 4.77 benchmarks | 132 | 147 | – | – | 122 | 7 | – | |
| 57 | Inkling Smallopen163 GB · 12 benchmarks | – | – | 117 | 118 | 122 | 12 | 163 GB | |
| 58 | Gemini 3 Pro Preview17 benchmarks | 124 | 127 | 120 | 126 | 122 | 17 | – | |
| 59 | Inklingopen575 GB · 21 benchmarks | 104 | – | 112 | 116 | 121 | 21 | 575 GB | |
| 60 | Muse Spark 1.36 benchmarks | – | – | 131 | – | 121 | 6 | – | |
| 61 | Grok 4.311 benchmarks | – | – | 117 | 118 | 120 | 11 | – | |
| 62 | Qwen3.6 Max Preview8 benchmarks | – | – | – | – | 120 | 8 | – | |
| 63 | GLM 5.2open454 GB · 24 benchmarks | 120 | 132 | 126 | 128 | 120 | 24 | 454 GB | |
| 64 | Kimi K2.6open618 GB · 18 benchmarks | 119 | – | 122 | 122 | 119 | 18 | 618 GB | |
| 65 | GPT 5 Pro (Oct 06, 2025)5 benchmarks | – | – | 123 | – | 119 | 5 | – | |
| 66 | Grok 4.1 Fast Reasoning6 benchmarks | – | – | – | – | 119 | 6 | – | |
| 67 | Qwen3.8 27Bopen17.9 GB · 9 benchmarks | 112 | – | 118 | 112 | 119 | 9 | 17.9 GB | |
| 68 | GPT 5.1 (Nov 13, 2025)14 benchmarks | 121 | – | – | – | 119 | 14 | – | |
| 69 | Kimi K2.7 Codeopen618 GB · 19 benchmarks | 115 | 119 | 121 | 118 | 118 | 19 | 618 GB | |
| 70 | Grok 4.20 0309 Reasoning8 benchmarks | – | – | 118 | – | 118 | 8 | – | |
| 71 | DeepSeek V4 Proopen960 GB · 22 benchmarks | 111 | – | 118 | 122 | 117 | 22 | 960 GB | |
| 72 | Grok 4 (Jul 09)12 benchmarks | 111 | 103 | – | – | 117 | 12 | – | |
| 73 | GPT 5 (Aug 07, 2025)20 benchmarks | 120 | – | 122 | 118 | 117 | 20 | – | |
| 74 | GPT 5.4 Mini (Mar 17, 2026)12 benchmarks | – | – | 120 | 118 | 116 | 12 | – | |
| 75 | Claude Sonnet 4.5 (Sep 29, 2025)11 benchmarks | – | 115 | – | 105 | 115 | 11 | – | |
| 76 | NVIDIA Nemotron 3 Ultra 550B A55B BF16open378 GB · 14 benchmarks | 103 | – | 112 | 112 | 115 | 14 | 378 GB | |
| 77 | Qwen3.7 Plus9 benchmarks | 103 | – | – | 117 | 115 | 9 | – | |
| 78 | GLM 5.1open454 GB · 13 benchmarks | 114 | 127 | 117 | 117 | 115 | 13 | 454 GB | |
| 79 | O3 (Apr 16, 2025)19 benchmarks | 114 | – | 112 | 110 | 115 | 19 | – | |
| 80 | Claude Opus 4 (May 14, 2025)7 benchmarks | – | – | – | 96 | 115 | 7 | – | |
| 81 | Claude Opus 4.1 (Aug 05, 2025)6 benchmarks | – | – | – | – | 115 | 6 | – | |
| 82 | Qwen3.5 397B A17Bopen274 GB · 9 benchmarks | – | – | 112 | – | 115 | 9 | 274 GB | |
| 83 | Qwen3.7 Flash5 benchmarks | – | – | 109 | – | 115 | 5 | – | |
| 84 | Kimi K2.5open618 GB · 20 benchmarks | 110 | 111 | – | 117 | 114 | 20 | 618 GB | |
| 85 | MiniMax M2.5open140 GB · 11 benchmarks | 109 | 110 | – | – | 114 | 11 | 140 GB | |
| 86 | DeepSeek V3.2 Expopen413 GB · 10 benchmarks | 107 | – | – | 101 | 113 | 10 | 413 GB | |
| 87 | O3 Pro (Jun 10, 2025)6 benchmarks | 117 | – | – | – | 113 | 6 | – | |
| 88 | Qwen3.5 122B A10Bopen88.1 GB · 6 benchmarks | – | – | – | 96 | 112 | 6 | 88.1 GB | |
| 89 | Gemini 3.5 Flash Lite11 benchmarks | 103 | – | 106 | – | 112 | 11 | – | |
| 90 | DeepSeek V3.2open413 GB · 13 benchmarks | 95 | 109 | – | – | 112 | 13 | 413 GB | |
| 91 | Qwen3.5 Flash10 benchmarks | – | – | 106 | – | 112 | 10 | – | |
| 92 | Gemini 2.5 Pro13 benchmarks | – | 102 | 109 | 112 | 112 | 13 | – | |
| 93 | DeepSeek V4 Flashopen175 GB · 10 benchmarks | 107 | – | – | 111 | 112 | 10 | 175 GB | |
| 94 | Qwen3.5 Plus11 benchmarks | – | – | – | – | 112 | 11 | – | |
| 95 | GPT 5 Mini (Aug 07, 2025)15 benchmarks | 111 | – | 117 | – | 111 | 15 | – | |
| 96 | MiMo V2.5 Proopen616 GB · 6 benchmarks | 116 | – | – | 115 | 111 | 6 | 616 GB | |
| 97 | GPT 5.4 Nano (Mar 17, 2026)6 benchmarks | – | – | – | 115 | 111 | 6 | – | |
| 98 | O4 Mini (Apr 16, 2025)19 benchmarks | 110 | – | 112 | 108 | 111 | 19 | – | |
| 99 | Qwen3.5 27Bopen17.9 GB · 6 benchmarks | 98 | – | – | – | 111 | 6 | 17.9 GB | |
| 100 | Claude 3.7 Sonnet (Feb 19, 2025)4 benchmarks | – | – | – | – | 110 | 4 | – | |
| 101 | Grok 4 Fast6 benchmarks | – | – | – | – | 110 | 6 | – | |
| 102 | Qwen3.6 Plus15 benchmarks | 108 | – | 116 | 114 | 110 | 15 | – | |
| 103 | Gemma 4 31B ITopen21.7 GB · 11 benchmarks | 108 | – | – | 105 | 109 | 11 | 21.7 GB | |
| 104 | GLM 5open454 GB · 15 benchmarks | 110 | 118 | – | – | 109 | 15 | 454 GB | |
| 105 | Claude Haiku 4.5 (Oct 01, 2025)8 benchmarks | – | – | 104 | – | 109 | 8 | – | |
| 106 | DeepSeek V3.1 Terminusopen412 GB · 5 benchmarks | 108 | – | – | 103 | 108 | 5 | 412 GB | |
| 107 | Tiny Recursion Model2 benchmarks | — | – | – | – | – | 107 | 2 | – |
| 108 | MiniMax M3open258 GB · 19 benchmarks | 113 | 113 | 106 | 118 | 107 | 19 | 258 GB | |
| 109 | Gemini 3.1 Flash Lite6 benchmarks | – | – | 109 | – | 107 | 6 | – | |
| 110 | Qwen3.6 35B A3Bopen22.0 GB · 12 benchmarks | 105 | – | 109 | 110 | 107 | 12 | 22.0 GB | |
| 111 | Qwen3.6 27Bopen17.9 GB · 12 benchmarks | 102 | – | 114 | 111 | 106 | 12 | 17.9 GB | |
| 112 | Gemini 2.5 Pro Preview (Mar 25)6 benchmarks | – | – | – | – | 106 | 6 | – | |
| 113 | GLM 5.3 Flashopen205 GB · 17 benchmarks | 113 | 135 | 121 | 124 | 106 | 17 | 205 GB | |
| 114 | Qwen Plus (Apr 28, 2025)2 benchmarks | — | – | – | – | – | 106 | 2 | – |
| 115 | Qwen3 235B A22B Thinking 2507open143 GB · 13 benchmarks | 103 | – | – | 108 | 106 | 13 | 143 GB | |
| 116 | Qwen3.5 35B A3Bopen22.0 GB · 8 benchmarks | – | – | – | 108 | 106 | 8 | 22.0 GB | |
| 117 | DeepSeek V3.1open412 GB · 7 benchmarks | – | – | – | – | 105 | 7 | 412 GB | |
| 118 | Qwen3 Max (Sep 23, 2025)13 benchmarks | – | – | 105 | – | 105 | 13 | – | |
| 119 | Gemini 2.5 Flash Preview (May 20)6 benchmarks | – | – | – | – | 105 | 6 | – | |
| 120 | GLM 4.7open218 GB · 13 benchmarks | 101 | 106 | 111 | 111 | 104 | 13 | 218 GB |
The range after each score is a 90% interval: given the boards a model has results on, its true score is very likely inside it. Short ranges mean many agreeing results; long ranges mean few or conflicting ones.
Why some models are missing. A model gets a score only with results on at least 4 benchmarks across at least 2 categories, one of them reasoning or coding. Skill scores need at least 2 benchmarks in that skill; otherwise they show as –.
VRAM is llmrun's estimate at Q4_K_M (or the smallest quantization we track) for the weights plus room for a 16K-token context. Longer contexts need more memory. Proprietary models can't run locally, so the VRAM filter hides them.
How the llmrun Composite Score is built · llmrun does not run these benchmarks; scores are aggregated from public sources.