Chinese SimpleQA (C-SimpleQA) — Same underlying Chinese SimpleQA eval; raws 'Correct' vs 'Pass@1' likely same metric, ranges overlap
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro | 85.9 | 2 | 2026-07-04 | |
| 2 | DeepSeek-V4-Flash | DeepSeek | 78.9 | 1 | 2026-07-04 |
| 3 | DeepSeek-V4-Pro | DeepSeek | 77.7 | 1 | 2026-07-04 |
| 4 | Kimi K2 Base | Moonshot | 77.6 | 6 | 2026-06-13 |
| 5 | GPT-5.4 | OpenAI | 76.8 | 2 | 2026-07-04 |
| 6 | Claude Opus 4.6 | Anthropic | 76.4 | 2 | 2026-07-04 |
| 7 | Kimi K2.6 | Moonshot | 75.9 | 2 | 2026-07-04 |
| 8 | DeepSeek-V3.1-Base | DeepSeek | 70.9 | 4 | 2026-06-13 |
| 9 | GLM-4.5-Base | Z.ai | 70.1 | 4 | 2026-06-12 |
| 10 | Hy3 preview-Base | Tencent | 69.7 | 2 | 2026-06-05 |
| 11 | DeepSeek-V3-Base | DeepSeek | 68.7 | 2 | 2026-06-05 |
| 12 | DeepSeek-V3.2-Exp-Base | DeepSeek | 68 | 4 | 2026-06-13 |
| 13 | DeepSeek-V3 | DeepSeek | 68 | 6 | 2026-06-06 |
| 14 | MiniMax Text 01 | MiniMax | 67.4 | 1 | 2026-06-06 |
| 15 | R1-Zero | DeepSeek | 66.4 | 1 | 2026-05-03 |
| 16 | GPT-4o | OpenAI | 64.6 | 6 | 2026-06-06 |
| 17 | DeepSeek-R1 | DeepSeek | 63.7 | 5 | 2026-06-04 |
| 18 | Gemini 2.0 Flash Exp | 63.3 | 1 | 2026-06-06 | |
| 19 | Step3.5 Flash Base | StepFun | 63.2 | 2 | 2026-06-12 |
| 20 | MiMo V2 Flash Base | Xiaomi | 61.5 | 4 | 2026-06-13 |
| 21 | Gemini 1.5 Pro | 59.4 | 1 | 2026-06-06 | |
| 22 | Claude 3.5 Sonnet | Anthropic | 56.8 | 6 | 2026-06-06 |
| 23 | Llama 3.1 Instruct 405B | Meta | 54.7 | 2 | 2026-06-06 |
| 24 | DeepSeek-V2.5 | DeepSeek | 54.1 | 1 | 2026-05-03 |
| 25 | Qwen2.5 Instruct 72B | Alibaba | 52.2 | 2 | 2026-06-06 |
| 26 | DeepSeek-V2 | DeepSeek | 48.5 | 1 | 2026-05-03 |
| 27 | OpenAI o1-mini | OpenAI | 40.3 | 4 | 2026-06-04 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.