Harvard-MIT Math Tournament (HMMT) 2025 — Umbrella 2025 entry w/o Feb/Nov qualifier; raws incl. bare 'HMMT25' - kept sep. per version rule.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | GPT-5.2 Pro | OpenAI | 100 | 1 | 2026-08-23 |
| 2 | GPT-5.2 | OpenAI | 99.4 | 1 | 2026-08-23 |
| 3 | DeepSeek-V3.2-Speciale | DeepSeek | 99.2 | 1 | 2026-08-23 |
| 4 | Kimi K2.5 | Moonshot | 95.4 | 1 | 2026-08-23 |
| 5 | Nemotron 3 Super 120B A12B | NVIDIA | 94.7 | 1 | 2026-08-23 |
| 6 | Qwen3.6 Plus | Alibaba | 94.6 | 1 | 2026-08-23 |
| 7 | PaCoRe-8B | StepFun | 94.5 | 1 | 2026-06-25 |
| 8 | GLM-5.2 Full Open Source | Z.ai | 94.4 | 1 | 2026-08-23 |
| 9 | GLM-5.1 | Z.ai | 94 | 1 | 2026-08-23 |
| 10 | Grok 4 Fast | SpaceXAI | 93.3 | 2 | 2026-08-23 |
| 11 | GPT-5 | OpenAI | 93.3 | 5 | 2026-08-23 |
| 12 | Qwen3.5 397B A17B | Alibaba | 92.7 | 1 | 2026-08-23 |
| 13 | Step3 VL 10B | StepFun | 92.1 | 2 | 2026-06-05 |
| 14 | Qwen3.6 27B | Alibaba | 90.7 | 1 | 2026-08-23 |
| 15 | Qwen3.5 122B A10B | Alibaba | 90.3 | 1 | 2026-08-23 |
| 16 | DeepSeek-V3.2 | DeepSeek | 90.2 | 2 | 2026-08-23 |
| 17 | Grok 4 | SpaceXAI | 90 | 2 | 2026-08-23 |
| 18 | Qwen3.5 27B | Alibaba | 89.8 | 1 | 2026-08-23 |
| 19 | Kimi K2 (Reasoning) | Moonshot | 89.4 | 4 | 2026-06-25 |
| 20 | Qwen3.5 35B A3B | Alibaba | 89.2 | 1 | 2026-08-23 |
| 21 | Qwen3.6 35B A3B | Alibaba | 89.1 | 1 | 2026-08-23 |
| 22 | GLM-4.6 | Z.ai | 88.7 | 2 | 2026-06-25 |
| 23 | GPT-5 mini | OpenAI | 87.8 | 2 | 2026-08-23 |
| 24 | DeepSeek-V3.1-Terminus | DeepSeek | 86.1 | 2 | 2026-06-25 |
| 25 | Sarvam 105B | Sarvam AI | 85.8 | 1 | 2026-08-23 |
| 26 | MiMo V2 Flash | Xiaomi | 84.4 | 1 | 2026-08-23 |
| 27 | DeepSeek-V3.2-Exp | DeepSeek | 83.6 | 1 | 2026-08-23 |
| 28 | Qwen3.5 9B | Alibaba | 82.9 | 1 | 2026-08-23 |
| 29 | Qwen3 235B Thinking | Alibaba | 82.3 | 2 | 2026-06-25 |
| 30 | DeepSeek-R1 | DeepSeek | 79.4 | 1 | 2026-08-23 |
| 31 | Qwen3 VL 235B A22B Reasoning | Alibaba | 77.4 | 3 | 2026-08-23 |
| 32 | Qwen3.5 4B | Alibaba | 76.8 | 1 | 2026-08-23 |
| 33 | GPT-5 nano | OpenAI | 75.6 | 1 | 2026-08-23 |
| 34 | RLVR-8B | StepFun | 75.4 | 2 | 2026-06-25 |
| 35 | Claude Sonnet 4.5 | Anthropic | 74.6 | 1 | 2026-05-15 |
| 36 | Sarvam 30B | Sarvam AI | 74.2 | 1 | 2026-08-23 |
| 37 | Grok 3 Mini Reasoning | SpaceXAI | 74 | 1 | 2026-07-13 |
| 38 | Qwen3 Next 80B A3B | Alibaba | 73.9 | 1 | 2026-08-23 |
| 39 | Qwen3 VL 30B A3B Reasoning | Alibaba | 67.6 | 1 | 2026-08-23 |
| 40 | Gemini 2.5 Pro | 65.7 | 2 | 2026-06-05 | |
| 41 | Qwen3 VL Thinking (8B) | Alibaba | 60.6 | 1 | 2026-08-23 |
| 42 | Qwen3 VL 235B A22B Instruct | Alibaba | 57.4 | 1 | 2026-08-23 |
| 43 | GLM-4.6V (106B-A12B) | Z.ai | 57.3 | 2 | 2026-06-05 |
| 44 | Qwen3 235B A22B Instruct 2507 | Alibaba | 55.4 | 1 | 2026-08-23 |
| 45 | Qwen3 Next 80B A3B Instruct | Alibaba | 54.1 | 1 | 2026-08-23 |
| 46 | Qwen3 VL 4B (Reasoning) | Alibaba | 53.1 | 1 | 2026-08-23 |
| 47 | Qwen3 VL 30B A3B Instruct | Alibaba | 50.6 | 1 | 2026-08-23 |
| 48 | Kimi K2 Instruct | Moonshot | 38.8 | 4 | 2026-08-23 |
| 49 | GPT-4.1 mini | OpenAI | 35 | 1 | 2026-08-23 |
| 50 | DeepSeek-V3.1 | DeepSeek | 33.5 | 1 | 2026-08-23 |
| 51 | Qwen3 VL 8B Instruct | Alibaba | 32.5 | 1 | 2026-08-23 |
| 52 | Qwen3 VL 4B Instruct | Alibaba | 30.7 | 1 | 2026-08-23 |
| 53 | GPT-4.1 | OpenAI | 28.9 | 1 | 2026-08-23 |
| 54 | DeepSeek-V3 | DeepSeek | 27.5 | 2 | 2026-06-15 |
| 55 | Claude Sonnet 4 | Anthropic | 15.9 | 2 | 2026-06-15 |
| 56 | Claude 4 Opus | Anthropic | 15.9 | 2 | 2026-06-15 |
| 57 | Qwen3 235B A22B | Alibaba | 11.9 | 2 | 2026-06-15 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.