MATH-500 — Same real benchmark as math_500_em per raw overlap; kept separate given metric-name divergence.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | MiMo 7B RL | Xiaomi | 97.2 | 9 | 2026-06-12 |
| 2 | R1-Distill-Qwen-14B | Alibaba | 93.9 | 1 | 2026-05-16 |
| 3 | MiMo 7B RL Zero | Xiaomi | 93.6 | 4 | 2026-06-05 |
| 4 | MiMo 7B SFT | Xiaomi | 93 | 5 | 2026-06-05 |
| 5 | R1-Distill-Qwen-7B | Alibaba | 92.8 | 1 | 2026-05-16 |
| 6 | QwQ 32B Preview | Alibaba | 90.6 | 1 | 2026-05-16 |
| 7 | OpenAI o1-mini | OpenAI | 90 | 1 | 2026-05-16 |
| 8 | LFM2.5-8B-A1B | Liquid AI | 88.8 | 1 | 2026-08-09 |
| 9 | Qwen3 30B A3B | Alibaba | 86.5 | 1 | 2026-08-09 |
| 10 | Qwen3.5 4B | Alibaba | 80.8 | 1 | 2026-08-09 |
| 11 | Claude 3.5 Sonnet | Anthropic | 78.3 | 1 | 2026-05-16 |
| 12 | GPT-4o | OpenAI | 74.6 | 1 | 2026-05-16 |
| 13 | Gemma 4 E4B | 65 | 1 | 2026-08-09 | |
| 14 | Gemma 4 E2B | 64 | 1 | 2026-08-09 | |
| 15 | Granite 4.0 H Tiny | IBM | 59.2 | 1 | 2026-08-09 |
| 16 | MiMo 7B Base | Xiaomi | 37.4 | 5 | 2026-06-05 |
| 17 | LFM2.5-8B-A1B-DSpark | Liquid AI | 8.3 | 2 | 2026-08-21 |
| 18 | LFM2.5-2.6B-DSpark | Liquid AI | 5.4 | 2 | 2026-08-21 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.