Reasoning

Mystery Game Puzzles Leaderboard

Mystery Game Puzzles is an Epoch AI evaluation of multi-step deductive reasoning: the model works through a mystery or logic-game scenario to arrive at the correct solution. It probes sustained, structured inference rather than single-step question answering.

Source: epoch17 open models ranked+105 proprietaryData through Sep 2026

All models ranked on Mystery Game Puzzles

Proprietary / closed models are shown dimmed — you can't run them locally, but they show where the open field stands.

#ModelScore
1GPT 6 Astra Max · proprietary
84.0%
2Claude Opus 5 Max · proprietary
59.0%
3Claude Fable 5.1 Max · proprietary
58.0%
4GPT 5.6 Sol Max · proprietary
58.0%
5GPT 5.5 (xhigh) · proprietary
56.0%
6Claude Fable 5 Max · proprietary
52.0%
7GPT 5.5 (high) · proprietary
52.0%
8Gemini 3.8 Flash (high) · proprietary
47.0%
9DeepSeek V4 Pro 0813 · 1650.5B
43.0%
10Qwen3.8 Max (xhigh) · proprietary
38.0%
11Claude Opus 5 · proprietary
37.0%
12Gemini 3.7 Flash (high) · proprietary
37.0%
13GPT 5.4 (Mar 05, 2026, xhigh) · proprietary
37.0%
14Claude Opus 4.8 Max · proprietary
36.0%
15Claude Sonnet 5 Max · proprietary
35.0%
16GPT 5.6 Terra Max · proprietary
35.0%
17DeepSeek V4 Flash 0731 · 304.2B
34.0%
18Gemini 3.1 Pro Preview (high) · proprietary
34.0%
19Grok 4.6 (xhigh) · proprietary
34.0%
20GLM 5.3 · 753.3B
33.0%
21GPT 5.6 Sol None · proprietary
33.0%
22Gemini 3.1 Pro Preview (medium) · proprietary
32.0%
23Gemini 3.5 Flash (high) · proprietary
32.0%
24Qwen3.7 Max · proprietary
32.0%
25Claude Opus 4.8 (xhigh) · proprietary
31.0%
26Gemini 3.6 Flash (high) · proprietary
30.0%
27Gemini 3.1 Pro Preview (low) · proprietary
29.0%
28O3 (Apr 16, 2025, high) · proprietary
29.0%
29Claude Opus 4.7 Max · proprietary
28.0%
30Gemini 3.5 Flash (low) · proprietary
28.0%
31GPT 5.4 (Mar 05, 2026, medium) · proprietary
28.0%
32GPT 5.5 (low) · proprietary
28.0%
33Gemini 3 Flash Preview (low) · proprietary
26.0%
34GPT 5.6 Sol (low) · proprietary
26.0%
35Kimi K3 · 2779.9B
26.0%
36Qwen3.7 Max None · proprietary
26.0%
37Claude Opus 4.6 Max · proprietary
25.0%
38Gemini 3 Flash Preview (minimal) · proprietary
25.0%
39Gemini 3.6 Flash (minimal) · proprietary
25.0%
40Muse Spark 1.3 Max · proprietary
25.0%
41Gemini 3.6 Flash (low) · proprietary
23.0%
42GPT 5 (Aug 07, 2025, high) · proprietary
23.0%
43GPT 5.2 (Dec 11, 2025, high) · proprietary
23.0%
44O3 (Apr 16, 2025, medium) · proprietary
23.0%
45Claude Opus 4.5 (Nov 01, 2025, 48K) · proprietary
22.0%
46GPT 5.2 (Dec 11, 2025, medium) · proprietary
22.0%
47Qwen3.6 35B A3B · 36.0B
22.0%
48Claude Opus 4.1 (Aug 05, 2025, 24K) · proprietary
21.0%
49GPT 5.6 Luna Max · proprietary
21.0%
50Gemini 3 Flash Preview (high) · proprietary
20.0%
51GPT 5.6 Luna None · proprietary
20.0%
52NVIDIA Nemotron 3 Ultra 550B A55B BF16 · 560.5B
20.0%
53Qwen3.5 Flash · proprietary
20.0%
54Gemini 3.5 Flash Lite (low) · proprietary
19.0%
55GLM 5.2 · 753.3B
19.0%
56GPT 5.1 (Nov 13, 2025, low) · proprietary
19.0%
57GPT 5.6 Terra (low) · proprietary
19.0%
58Qwen3.6 Max Preview None · proprietary
19.0%
59GPT 5.5 None · proprietary
18.0%
60Kimi K2.6 · 1026.9B
18.0%
61Qwen3.5 397B A17B · 403.4B
18.0%
62Qwen3.6 Flash None · proprietary
18.0%
63Claude Sonnet 4.5 (Sep 29, 2025, 48K) · proprietary
17.0%
64DeepSeek V4 Pro · 1598.8B
17.0%
65GPT 5.4 (Mar 05, 2026, low) · proprietary
17.0%
66GPT 5.6 Luna (low) · proprietary
17.0%
67Qwen3.5 122B A10B · 125.1B
17.0%
68Qwen3.5 Plus None · proprietary
17.0%
69Qwen3.7 Plus · proprietary
17.0%
70Qwen3.7 Plus None · proprietary
17.0%
71Claude Sonnet 4.6 (low) · proprietary
16.0%
72Claude Sonnet 5 · proprietary
16.0%
73GPT 5 (Aug 07, 2025, low) · proprietary
16.0%
74GPT 5.1 (Nov 13, 2025, medium) · proprietary
16.0%
75GPT 5.4 2026 03.05 None · proprietary
16.0%
76Qwen3.5 Flash None · proprietary
16.0%
77Qwen3.5 Plus · proprietary
16.0%
78Claude Opus 4.6 · proprietary
15.0%
79GPT 5 (Aug 07, 2025, medium) · proprietary
15.0%
80GPT 5.1 2025 11.13 None · proprietary
15.0%
81Qwen3.7 Flash · proprietary
15.0%
82Muse Spark 1.3 (xhigh) · proprietary
14.1%
83Claude Sonnet 4.6 · proprietary
14.0%
84GPT 5 (Aug 07, 2025, minimal) · proprietary
14.0%
85GPT 5.2 2025 12.11 None · proprietary
14.0%
86GPT 5.6 Terra None · proprietary
14.0%
87Qwen3.7 Flash None · proprietary
14.0%
88Claude Opus 4.7 · proprietary
13.0%
89Gemini 3.5 Flash Lite (minimal) · proprietary
12.0%
90GPT 4 (Jun 13) · proprietary
12.0%
91GPT 4o Mini (Jul 18, 2024) · proprietary
12.0%
92GPT 5.6 Luna (medium) · proprietary
12.0%
93Qwen3.6 Flash · proprietary
12.0%
94Qwen3.6 Plus None · proprietary
12.0%
95GPT 5.4 Mini 2026 03.17 None · proprietary
11.0%
96GPT 5 Mini (Aug 07, 2025, minimal) · proprietary
10.0%
97GPT 5.2 (Dec 11, 2025, low) · proprietary
10.0%
98GPT 5.6 Terra (medium) · proprietary
10.0%
99GPT 5 Nano (Aug 07, 2025, low) · proprietary
9.0%
100GPT 5 Nano (Aug 07, 2025, medium) · proprietary
9.0%
101GPT 5.4 Nano 2026 03.17 None · proprietary
9.0%
102Qwen3 235B A22B Thinking 2507 · 235.1B
9.0%
103GLM 5.3 Flash · 321.3B
8.0%
104GPT 5 Nano (Aug 07, 2025, high) · proprietary
8.0%
105GPT 5.4 Mini (Mar 17, 2026, low) · proprietary
8.0%
106MiniMax M3 · 427.0B
8.0%
107Claude Opus 4.6 (low) · proprietary
7.0%
108GPT 4.1 Mini (Apr 14, 2025) · proprietary
7.0%
109GPT 5.4 Mini (Mar 17, 2026, medium) · proprietary
7.0%
110O3 Mini (Jan 31, 2025, high) · proprietary
7.0%
111Qwen3.6 27B · 27.8B
7.0%
112GPT 5.4 Nano (Mar 17, 2026, medium) · proprietary
6.0%
113Inkling Small · 266.0B
6.0%
114GPT 5 Mini (Aug 07, 2025, high) · proprietary
5.0%
115GPT 5 Nano (Aug 07, 2025, minimal) · proprietary
5.0%
116GPT 5.4 Nano (Mar 17, 2026, high) · proprietary
5.0%
117O4 Mini (Apr 16, 2025, high) · proprietary
5.0%
118Qwen3 Max (Sep 23, 2025) · proprietary
5.0%
119GPT 5 Mini (Aug 07, 2025, medium) · proprietary
4.0%
120GPT 3.5 Turbo (Jan 25) · proprietary
3.0%
121GPT 5.4 Nano (Mar 17, 2026, low) · proprietary
3.0%
122GPT OSS 120B · 116.8B
2.0%

Score vs model size

Which models give the most quality for their size — the ones worth running locally.

100B1Tmodel size (log scale) →43.0%2.0%GLM 5.3 · 753B · 33.0%Kimi K3 · 2.8T · 26.0%NVIDIA Nemotron 3 Ultra 550B A55B BF16 · 561B · 20.0%GLM 5.2 · 753B · 19.0%Kimi K2.6 · 1T · 18.0%Qwen3.5 397B A17B · 403B · 18.0%DeepSeek V4 Pro · 1.6T · 17.0%Qwen3.5 122B A10B · 125B · 17.0%Qwen3 235B A22B Thinking 2507 · 235B · 9.0%MiniMax M3 · 427B · 8.0%GLM 5.3 Flash · 321B · 8.0%Inkling Small · 266B · 6.0%GPT OSS 120B · 117B · 2.0%Qwen3.6 27B · 28B · 7.0%Qwen3.6 27BQwen3.6 35B A3B · 36B · 22.0%Qwen3.6 35B A3BDeepSeek V4 Flash 0731 · 304B · 34.0%DeepSeek V4 Flash 0731DeepSeek V4 Pro 0813 · 1.7T · 43.0%DeepSeek V4 Pro 0813
Each dot is a model. Up = higher score, left = smaller (easier to run locally). The dashed line marks the efficiency frontier — the best score you can get at each size or smaller.
  • Qwen3.6 27B, 28B, score 7.0% — on the efficiency frontier (best score at its size or smaller).
  • Qwen3.6 35B A3B, 36B, score 22.0% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek V4 Flash 0731, 304B, score 34.0% — on the efficiency frontier (best score at its size or smaller).
  • DeepSeek V4 Pro 0813, 1.7T, score 43.0% — on the efficiency frontier (best score at its size or smaller).

Mystery Game Puzzles: frequently asked questions

What is the best open LLM on Mystery Game Puzzles?
DeepSeek V4 Pro 0813 is the top open model on Mystery Game Puzzles, scoring 43.0%. Among all models tested — including proprietary ones — it ranks #9. The top model overall is GPT 6 Astra Max (OpenAI) at 84.0%.
What's the best Mystery Game Puzzles model you can run on a 24 GB GPU?
Qwen3.6 35B A3B is the highest-scoring open model that fits in 24 GB at 4-bit quantization (about 20 GB), scoring 22.0% on Mystery Game Puzzles.
Can open models match proprietary models on Mystery Game Puzzles?
Not quite on Mystery Game Puzzles: the strongest proprietary model (GPT 6 Astra Max) scores 84.0%, ahead of the best open model (DeepSeek V4 Pro 0813) at 43.0% — but you can run the open one yourself.

Scores aggregated from epoch. llmrun does not run this benchmark — see the source for methodology, or the about benchmarks for what it measures.

Mystery Game Puzzles Leaderboard — LLM Scores | llmrun