MGSM (Multilingual Grade School Math) — Base MGSM aggregate bucket, distinct from the DeepSeek-V4-family 'MGSM (EM)' explicit-metric entry.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Llama 4 Maverick | Meta | 92.3 | 2 | 2026-08-23 |
| 2 | o3-mini | OpenAI | 92 | 1 | 2026-08-23 |
| 3 | Claude 3.5 Sonnet | Anthropic | 91.6 | 1 | 2026-08-23 |
| 4 | Llama 3.1 Instruct 405B | Meta | 91.6 | 3 | 2026-05-01 |
| 5 | Llama 3.3 70B Instruct | Meta | 91.1 | 3 | 2026-08-23 |
| 6 | o1 | OpenAI | 90.8 | 1 | 2026-08-23 |
| 7 | Claude 3 Opus | Anthropic | 90.7 | 1 | 2026-08-23 |
| 8 | Llama 4 Scout | Meta | 90.6 | 3 | 2026-08-23 |
| 9 | GPT-4o | OpenAI | 90.5 | 2 | 2026-08-23 |
| 10 | GPT-4 Turbo | OpenAI | 88.5 | 1 | 2026-08-23 |
| 11 | Nemotron 3 Ultra 550B A55B Base | NVIDIA | 87.7 | 1 | 2026-06-05 |
| 12 | NVIDIA-Nemotron-3-Ultra-550B-A55B-Base-BF16 | NVIDIA | 87.7 | 1 | 2026-08-24 |
| 13 | Gemini 1.5 Pro | 87.5 | 1 | 2026-08-23 | |
| 14 | Qwen2.5 Instruct 72B | Alibaba | 87.3 | 2 | 2026-05-30 |
| 15 | Gemma 3 4B | 87.3 | 1 | 2026-08-09 | |
| 16 | GPT-4o mini | OpenAI | 87 | 2 | 2026-08-23 |
| 17 | Llama 3.1 70B Instruct | Meta | 86.9 | 1 | 2026-05-01 |
| 18 | Claude 3.5 Haiku | Anthropic | 85.6 | 1 | 2026-08-23 |
| 19 | Kimi K2 Base | Moonshot | 85.2 | 1 | 2026-06-05 |
| 20 | Qwen3 235B A22B | Alibaba | 83.5 | 1 | 2026-08-23 |
| 21 | Claude 3 Sonnet | Anthropic | 83.5 | 1 | 2026-08-23 |
| 22 | Mistral Large 3 675B Base 2512 | Mistral | 82.9 | 1 | 2026-06-05 |
| 23 | DeepSeek-V3.2-Exp-Base | DeepSeek | 82.3 | 1 | 2026-06-05 |
| 24 | Granite 4.1 8B | IBM | 82.3 | 1 | 2026-06-15 |
| 25 | GLM-4.5-Base | Z.ai | 81.3 | 1 | 2026-06-05 |
| 26 | Phi 4 | Microsoft | 80.6 | 2 | 2026-08-23 |
| 27 | DeepSeek-V3 | DeepSeek | 79.8 | 1 | 2026-05-01 |
| 28 | Qwen 2.5 14B | Alibaba | 79.6 | 1 | 2026-05-30 |
| 29 | Claude 3 Haiku | Anthropic | 75.1 | 1 | 2026-08-23 |
| 30 | GPT4 | OpenAI | 74.5 | 1 | 2026-08-23 |
| 31 | Granite 4.1 30B Base | IBM | 74.4 | 2 | 2026-06-15 |
| 32 | LFM2 2.6B | Liquid AI | 74.3 | 1 | 2026-08-09 |
| 33 | Granite 4.1 30B | IBM | 71.1 | 1 | 2026-06-15 |
| 34 | Llama 3.1 8B Instruct | Meta | 68.9 | 1 | 2026-05-01 |
| 35 | Qwen3 1.7B | Alibaba | 66.6 | 1 | 2026-08-09 |
| 36 | Phi 4 Mini Instruct | Microsoft | 63.9 | 1 | 2026-08-23 |
| 37 | Granite 4.1 8B Base | IBM | 63.7 | 2 | 2026-06-15 |
| 38 | DeepSeek-V2 | DeepSeek | 63.6 | 1 | 2026-05-01 |
| 39 | Llama 3.2 3B Instruct | Meta | 61.7 | 2 | 2026-08-23 |
| 40 | Phi 3.5 MoE Instruct | Microsoft | 58.7 | 1 | 2026-08-23 |
| 41 | Granite 4.1 3B Base | IBM | 58.5 | 1 | 2026-06-15 |
| 42 | LFM2 1.2B | Liquid AI | 55 | 1 | 2026-08-09 |
| 43 | Phi 3 Medium 4K Instruct | Microsoft | 53.5 | 1 | 2026-05-30 |
| 44 | Phi 3.5 Mini Instruct | Microsoft | 47.9 | 1 | 2026-08-23 |
| 45 | LFM2-700M | Liquid AI | 45.4 | 1 | 2026-08-09 |
| 46 | Gemma 3 1B IT | 43.6 | 1 | 2026-08-09 | |
| 47 | Qwen3 0.6B | Alibaba | 41.3 | 1 | 2026-08-09 |
| 48 | Qwen2.5 7B Base | Alibaba | 36.5 | 1 | 2026-05-03 |
| 49 | Qwen2.5 3B Base | Alibaba | 34 | 1 | 2026-05-03 |
| 50 | Qwen3 4B Base Dense | Alibaba | 31 | 1 | 2026-05-03 |
| 51 | LFM2-350M | Liquid AI | 29.5 | 1 | 2026-08-09 |
| 52 | Gemma 3 1B Base Dense | 1.7 | 1 | 2026-05-03 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.