SimpleBench — General-reasoning/trick-question benchmark; unrelated to SimpleQA family despite similar name.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 81.9 | 1 | 2026-06-11 |
| 2 | Opus 5 | Anthropic | 80.6 | 1 | 2026-07-25 |
| 3 | Gemini 3.1 Pro | 79.6 | 1 | 2026-05-10 | |
| 4 | GPT-5.5 Pro | OpenAI | 76.9 | 1 | 2026-05-10 |
| 5 | Gemini 3.5 Flash | 76.7 | 1 | 2026-05-21 | |
| 6 | Gemini 3 Pro | 76.4 | 3 | 2026-05-19 | |
| 7 | Grok 4.6 | SpaceXAI | 75.9 | 1 | 2026-08-14 |
| 8 | Muse Spark 1.2 | Meta | 74.5 | 1 | 2026-08-14 |
| 9 | GPT-5.6 Sol Pro | OpenAI | 71.7 | 1 | 2026-07-10 |
| 10 | Qwen3.7 Max | Alibaba | 70.4 | 1 | 2026-05-22 |
| 11 | Grok4.5 | SpaceXAI | 70 | 1 | 2026-07-09 |
| 12 | GPT-5.5 | OpenAI | 69 | 1 | 2026-05-10 |
| 13 | Claude Opus 4.6 | Anthropic | 67.6 | 1 | 2026-05-10 |
| 14 | GLM-5.3 | Z.ai | 66.2 | 1 | 2026-08-21 |
| 15 | Claude Opus 4.8 | Anthropic | 64.8 | 1 | 2026-05-29 |
| 16 | GPT-5.6 Sol | OpenAI | 64.8 | 1 | 2026-07-10 |
| 17 | Qwen3.6 Max Preview | Alibaba | 63 | 1 | 2026-05-21 |
| 18 | Qwen3.8 2.4T A95B | Alibaba | 62.5 | 1 | 2026-08-14 |
| 19 | Gemini 2.5 Pro | 62.4 | 2 | 2026-05-10 | |
| 20 | Gemini 2.5 Pro Preview 06.05 (32k think) | 62.4 | 1 | 2026-05-30 | |
| 21 | Claude Opus 4.5 | Anthropic | 62 | 1 | 2026-05-10 |
| 22 | Claude Opus 4.7 | Anthropic | 61.7 | 1 | 2026-05-10 |
| 23 | GPT-5 Pro | OpenAI | 61.6 | 1 | 2026-05-10 |
| 24 | Gemini 3 Flash Preview | 61.1 | 1 | 2026-05-15 | |
| 25 | Kimi K3 | Moonshot | 60.7 | 1 | 2026-07-18 |
| 26 | Claude Sonnet 5 | Anthropic | 60.6 | 1 | 2026-07-10 |
| 27 | Grok 4 | SpaceXAI | 60.5 | 1 | 2026-05-10 |
| 28 | Qwen3.8 27B | Alibaba | 60.2 | 1 | 2026-08-21 |
| 29 | Claude Opus 4.1 | Anthropic | 60 | 2 | 2026-05-30 |
| 30 | GLM-5.2 Full Open Source | Z.ai | 58.8 | 2 | 2026-07-13 |
| 31 | Claude 4 Opus | Anthropic | 58.8 | 1 | 2026-05-10 |
| 32 | Kimi K2.7 Code | Moonshot | 57.9 | 1 | 2026-07-10 |
| 33 | GPT-5.2 Pro | OpenAI | 57.4 | 1 | 2026-05-10 |
| 34 | GPT-5 | OpenAI | 56.7 | 2 | 2026-05-19 |
| 35 | Grok 4.1 Fast | SpaceXAI | 56 | 1 | 2026-05-10 |
| 36 | GLM-5.1 | Z.ai | 55.1 | 1 | 2026-07-10 |
| 37 | Claude Sonnet 4.5 | Anthropic | 54.3 | 6 | 2026-08-10 |
| 38 | GPT-5.1 | OpenAI | 53.2 | 2 | 2026-06-20 |
| 39 | GLM-5 | Z.ai | 53.2 | 1 | 2026-05-10 |
| 40 | o3 | OpenAI | 53.1 | 1 | 2026-05-10 |
| 41 | DeepSeek-V3.2-Speciale | DeepSeek | 52.6 | 1 | 2026-05-10 |
| 42 | DeepSeek-V4-Pro | DeepSeek | 50.9 | 2 | 2026-06-28 |
| 43 | Inkling | Thinking Machines | 50 | 1 | 2026-07-23 |
| 44 | GPT-5.6 Terra | OpenAI | 48.9 | 1 | 2026-07-10 |
| 45 | GLM-4.7 | Z.ai | 47.7 | 1 | 2026-05-10 |
| 46 | Kimi K2.5 | Moonshot | 46.8 | 1 | 2026-05-10 |
| 47 | GPT-5.6 Luna | OpenAI | 46.8 | 1 | 2026-07-10 |
| 48 | Claude 3.7 Sonnet | Anthropic | 46.4 | 2 | 2026-05-10 |
| 49 | DeepSeek-V4-Flash | DeepSeek | 46.3 | 1 | 2026-06-03 |
| 50 | GPT-5.2 | OpenAI | 45.8 | 2 | 2026-05-19 |
| 51 | MiniMax M3 | MiniMax | 45.8 | 1 | 2026-07-10 |
| 52 | Claude Sonnet 4 | Anthropic | 45.5 | 2 | 2026-06-20 |
| 53 | Nemotron 3 Ultra 550B A55B | NVIDIA | 41.7 | 1 | 2026-06-08 |
| 54 | o1 | OpenAI | 41.7 | 2 | 2026-05-10 |
| 55 | Claude 3.5 Sonnet | Anthropic | 41.4 | 2 | 2026-05-10 |
| 56 | Gemini 2.5 Flash | 41.2 | 1 | 2026-05-10 | |
| 57 | DeepSeek-R1 | DeepSeek | 40.8 | 2 | 2026-05-10 |
| 58 | DeepSeek-V3.1 | DeepSeek | 40 | 2 | 2026-05-15 |
| 59 | Kimi K2 (Reasoning) | Moonshot | 39.6 | 2 | 2026-05-10 |
| 60 | o4-mini | OpenAI | 38.7 | 1 | 2026-05-10 |
| 61 | Grok 3 | SpaceXAI | 36.1 | 2 | 2026-06-19 |
| 62 | Qwen 3.6 Flash | Alibaba | 35.2 | 1 | 2026-07-10 |
| 63 | MiniMax M2.1 | MiniMax | 34.7 | 1 | 2026-05-10 |
| 64 | GPT-4.5 Preview | OpenAI | 34.5 | 1 | 2026-05-10 |
| 65 | Gemini Exp 1206 | 31.1 | 1 | 2026-05-10 | |
| 66 | Qwen3 235B A22B | Alibaba | 31 | 1 | 2026-05-10 |
| 67 | Gemini 2.0 Flash (Reasoning) | 30.7 | 1 | 2026-05-10 | |
| 68 | Llama 4 Maverick | Meta | 27.7 | 1 | 2026-05-10 |
| 69 | DeepSeek-V3 | DeepSeek | 27.2 | 2 | 2026-05-10 |
| 70 | Gemini 1.5 Pro | 27.1 | 1 | 2026-05-10 | |
| 71 | GPT-4.1 | OpenAI | 27 | 1 | 2026-05-10 |
| 72 | GPT-4 Turbo | OpenAI | 25.1 | 1 | 2026-05-10 |
| 73 | MiniMax M2 | MiniMax | 25 | 1 | 2026-05-10 |
| 74 | Claude 3 Opus | Anthropic | 23.5 | 1 | 2026-05-10 |
| 75 | Llama 3.1 Instruct 405B | Meta | 23 | 1 | 2026-05-10 |
| 76 | o3-mini | OpenAI | 22.8 | 1 | 2026-05-10 |
| 77 | Grok 2 | SpaceXAI | 22.7 | 1 | 2026-05-10 |
| 78 | Mistral Large 2 | Mistral | 22.5 | 1 | 2026-05-10 |
| 79 | GPT OSS 120B | OpenAI | 22.1 | 1 | 2026-05-10 |
| 80 | Mistral Large 3 | Mistral | 20.4 | 2 | 2026-06-19 |
| 81 | Llama 3.3 70B Instruct | Meta | 19.9 | 1 | 2026-05-10 |
| 82 | Gemini 2.0 Flash Exp | 18.9 | 1 | 2026-05-15 | |
| 83 | OpenAI o1-mini | OpenAI | 18.1 | 1 | 2026-05-10 |
| 84 | GPT-4o | OpenAI | 17.8 | 1 | 2026-05-10 |
| 85 | Command R+ (Apr '24) | Cohere | 17.4 | 1 | 2026-05-10 |
| 86 | GPT-4o mini | OpenAI | 10.7 | 1 | 2026-05-10 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.