C-Eval — Chinese multi-task exam benchmark; unlabeled metric assumed accuracy, matches chinese_ceval_acc
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba | 93.3 | 1 | 2026-08-23 |
| 2 | DeepSeek-V4-Pro-Base | DeepSeek | 93.1 | 3 | 2026-06-05 |
| 3 | Qwen3.5 397B A17B | Alibaba | 93 | 2 | 2026-08-23 |
| 4 | Kimi K2 Base | Moonshot | 92.5 | 10 | 2026-08-23 |
| 5 | Claude Opus 4.5 | Anthropic | 92.2 | 1 | 2026-06-15 |
| 6 | DeepSeek-V4-Flash-Base | DeepSeek | 92.1 | 3 | 2026-06-05 |
| 7 | Qwen3.5 122B A10B | Alibaba | 91.9 | 1 | 2026-08-23 |
| 8 | Hunyuan Large | Tencent | 91.9 | 1 | 2026-05-31 |
| 9 | DeepSeek-R1 | DeepSeek | 91.8 | 1 | 2026-07-06 |
| 10 | MiMo V2.5 Pro | Xiaomi | 91.5 | 1 | 2026-08-23 |
| 11 | MiMo V2.5 Pro Base | Xiaomi | 91.5 | 3 | 2026-06-05 |
| 12 | Qwen3.6 27B | Alibaba | 91.4 | 2 | 2026-08-23 |
| 13 | DeepSeek-V3.2-Exp-Base | DeepSeek | 91 | 4 | 2026-06-13 |
| 14 | Qwen3.5 27B | Alibaba | 90.5 | 3 | 2026-08-23 |
| 15 | DeepSeek-V3-Base | DeepSeek | 90.3 | 2 | 2026-06-05 |
| 16 | Qwen3.5 35B A3B | Alibaba | 90.2 | 2 | 2026-08-23 |
| 17 | DeepSeek-V3 | DeepSeek | 90.1 | 2 | 2026-08-23 |
| 18 | Qwen3.6 35B A3B | Alibaba | 90 | 3 | 2026-08-23 |
| 19 | DeepSeek-V3.1-Base | DeepSeek | 90 | 4 | 2026-06-13 |
| 20 | Hy3 preview-Base | Tencent | 89.8 | 2 | 2026-06-05 |
| 21 | Step3.5 Flash Base | StepFun | 89.6 | 2 | 2026-06-12 |
| 22 | Qwen2.5 Instruct 72B | Alibaba | 89.2 | 1 | 2026-05-01 |
| 23 | Hunyuan Large Inst. | Tencent | 88.6 | 1 | 2026-05-31 |
| 24 | MiMo V2.5 Base | Xiaomi | 88.6 | 3 | 2026-06-05 |
| 25 | Qwen3.5 9B | Alibaba | 88.2 | 1 | 2026-08-23 |
| 26 | MiMo V2 Flash Base | Xiaomi | 87.9 | 4 | 2026-06-13 |
| 27 | GLM-4.5-Base | Z.ai | 86.9 | 4 | 2026-06-12 |
| 28 | Qwen3.5 4B | Alibaba | 85.1 | 1 | 2026-08-23 |
| 29 | Qwen2 Instruct (72B) | Alibaba | 83.8 | 1 | 2026-08-23 |
| 30 | Gemma 4 31B | 82.6 | 2 | 2026-06-15 | |
| 31 | Gemma 4 26B A4B | 82.5 | 1 | 2026-06-06 | |
| 32 | DeepSeek-V2 | DeepSeek | 81.7 | 2 | 2026-05-31 |
| 33 | Qwen2 7B Instruct | Alibaba | 77.2 | 1 | 2026-08-23 |
| 34 | Moonlight | Moonshot | 77.2 | 2 | 2026-06-12 |
| 35 | Claude 3.5 Sonnet | Anthropic | 76.7 | 1 | 2026-07-06 |
| 36 | GPT-4o | OpenAI | 76 | 1 | 2026-07-06 |
| 37 | Qwen2.5 3B | Alibaba | 75 | 2 | 2026-06-05 |
| 38 | Qwen3.5 2B | Alibaba | 73.2 | 1 | 2026-08-23 |
| 39 | Llama 3.1 Instruct 405B | Meta | 72.5 | 1 | 2026-05-01 |
| 40 | OpenAI o1-mini | OpenAI | 68.9 | 1 | 2026-07-06 |
| 41 | Qwen3.5 0.8B | Alibaba | 50.5 | 1 | 2026-08-23 |
| 42 | ERNIE 4.5 | Baidu | 40.7 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.