MathVision (MATH-Vision) — Raw overlaps MathVision (full) but medians diverge (59.5 vs 33.8), disjoint rosters -- unsure.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot | 97.8 | 2 | 2026-08-24 |
| 2 | GPT-5.6 Sol | OpenAI | 95.8 | 1 | 2026-08-24 |
| 3 | Claude Fable 5 | Anthropic | 94.8 | 1 | 2026-08-24 |
| 4 | Qwen3.8 27B | Alibaba | 94.6 | 2 | 2026-08-24 |
| 5 | Kimi K2.6 | Moonshot | 93.2 | 2 | 2026-08-23 |
| 6 | GPT-5.4 | OpenAI | 92 | 1 | 2026-05-03 |
| 7 | Qwen3.7 Plus Preview | Alibaba | 90.3 | 2 | 2026-08-24 |
| 8 | Gemini 3.1 Pro | 89.8 | 2 | 2026-05-03 | |
| 9 | Qwen3.6 Plus | Alibaba | 88 | 1 | 2026-08-23 |
| 10 | Claude Opus 4.8 | Anthropic | 86.7 | 1 | 2026-08-24 |
| 11 | Qwen3.5 122B A10B | Alibaba | 86.2 | 1 | 2026-08-23 |
| 12 | Gemini 3 Pro | 86.1 | 1 | 2026-06-15 | |
| 13 | Qwen3.5 27B | Alibaba | 86 | 1 | 2026-08-23 |
| 14 | Gemma 4 31B | 85.6 | 27 | 2026-08-23 | |
| 15 | Qwen3.6 27B | Alibaba | 85.1 | 1 | 2026-08-24 |
| 16 | Kimi K2.5 | Moonshot | 84.2 | 3 | 2026-08-23 |
| 17 | Qwen3.5 35B A3B | Alibaba | 83.9 | 1 | 2026-08-23 |
| 18 | GPT-5.2 | OpenAI | 83 | 1 | 2026-06-15 |
| 19 | Gemma 4 26B A4B | 82.4 | 27 | 2026-08-23 | |
| 20 | Gemma 4 12B | 79.7 | 27 | 2026-08-23 | |
| 21 | Claude Opus 4.5 | Anthropic | 77.1 | 1 | 2026-06-15 |
| 22 | Step3 VL 10B | StepFun | 76 | 3 | 2026-08-23 |
| 23 | Qwen3 VL 235B A22B Reasoning | Alibaba | 74.6 | 3 | 2026-08-23 |
| 24 | Gemini 2.5 Pro | 73.3 | 2 | 2026-06-05 | |
| 25 | Claude Opus 4.6 | Anthropic | 71.2 | 2 | 2026-08-24 |
| 26 | Qwen3 VL 32B Reasoning | Alibaba | 70.2 | 1 | 2026-08-23 |
| 27 | Qwen3 VL 235B A22B Instruct | Alibaba | 66.5 | 1 | 2026-08-23 |
| 28 | Qwen3 VL 30B A3B Reasoning | Alibaba | 65.7 | 1 | 2026-08-23 |
| 29 | GLM-4.6V (106B-A12B) | Z.ai | 63.5 | 2 | 2026-06-05 |
| 30 | Qwen3 VL 32B Instruct | Alibaba | 63.4 | 1 | 2026-08-23 |
| 31 | Qwen3 VL Thinking (8B) | Alibaba | 62.7 | 3 | 2026-08-23 |
| 32 | Qwen3 VL 30B A3B Instruct | Alibaba | 60.2 | 1 | 2026-08-23 |
| 33 | Qwen3 VL 4B (Reasoning) | Alibaba | 60 | 1 | 2026-08-23 |
| 34 | MiMo VL RL 2508 (7B) | Xiaomi | 59.6 | 2 | 2026-06-05 |
| 35 | Gemma 4 E4B | 59.5 | 32 | 2026-08-23 | |
| 36 | Kimi VL A3B Thinking | Moonshot | 56.9 | 2 | 2026-06-05 |
| 37 | GLM-4.6V-Flash (9B) | Z.ai | 54 | 2 | 2026-06-05 |
| 38 | Qwen3 VL 8B Instruct | Alibaba | 53.9 | 1 | 2026-08-23 |
| 39 | Gemma 4 E2B | 52.4 | 37 | 2026-08-23 | |
| 40 | InternVL-3.5 (8B) | OpenGVLab | 52 | 2 | 2026-06-05 |
| 41 | Qwen3 VL 4B Instruct | Alibaba | 51.6 | 1 | 2026-08-23 |
| 42 | Gemma 3 27B | 46 | 28 | 2026-07-10 | |
| 43 | Qwen2.5 VL 32B | Alibaba | 38.4 | 2 | 2026-08-23 |
| 44 | Qwen2.5 VL 72B | Alibaba | 38.1 | 2 | 2026-08-23 |
| 45 | Gemma 3 12B | 32.1 | 2 | 2026-06-05 | |
| 46 | GPT-4o | OpenAI | 30.4 | 3 | 2026-08-24 |
| 47 | Qwen2-VL-72B-Instruct | Alibaba | 25.9 | 1 | 2026-08-24 |
| 48 | Qwen2.5 Omni 7B | Alibaba | 25 | 1 | 2026-08-23 |
| 49 | Kimi VL A3B Instruct | Moonshot | 21.7 | 2 | 2026-06-12 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.