AI2 Diagrams (AI2D) — Published diagram-VQA benchmark; '(Acc)' sibling kept separate (differing population/scale)
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude 3.5 Sonnet | Anthropic | 94.7 | 4 | 2026-08-24 |
| 2 | Qwen3.6 Plus | Alibaba | 94.4 | 1 | 2026-08-23 |
| 3 | GPT-4o | OpenAI | 94.2 | 3 | 2026-08-23 |
| 4 | Pixtral Large | Mistral | 93.8 | 1 | 2026-08-23 |
| 5 | Qwen3.5 122B A10B | Alibaba | 93.3 | 1 | 2026-08-23 |
| 6 | Qwen3.5 27B | Alibaba | 92.9 | 2 | 2026-08-24 |
| 7 | Qwen3.6 35B A3B | Alibaba | 92.7 | 2 | 2026-08-24 |
| 8 | Qwen3.5 35B A3B | Alibaba | 92.6 | 1 | 2026-08-23 |
| 9 | Qwen3 VL 235B A22B Instruct | Alibaba | 89.7 | 1 | 2026-08-23 |
| 10 | Qwen3 VL 32B Instruct | Alibaba | 89.5 | 1 | 2026-08-23 |
| 11 | Step3 VL 10B | StepFun | 89.3 | 2 | 2026-06-05 |
| 12 | Qwen3 VL 235B A22B Reasoning | Alibaba | 89.2 | 1 | 2026-08-23 |
| 13 | Gemma 4 31B | 89 | 1 | 2026-08-24 | |
| 14 | GLM-4.6V-Flash (9B) | Z.ai | 88.9 | 2 | 2026-06-05 |
| 15 | Qwen3 VL 32B Reasoning | Alibaba | 88.9 | 1 | 2026-08-23 |
| 16 | Qwen2.5 VL 72B | Alibaba | 88.4 | 1 | 2026-08-23 |
| 17 | Gemma 4 26B A4B | 88.3 | 1 | 2026-08-24 | |
| 18 | Claude Sonnet 4.5 | Anthropic | 87 | 1 | 2026-08-24 |
| 19 | Qwen3 VL 30B A3B Reasoning | Alibaba | 86.9 | 1 | 2026-08-23 |
| 20 | InternVL2.5-78B | OpenGVLab | 86.8 | 1 | 2026-06-05 |
| 21 | Qwen3 VL 8B Instruct | Alibaba | 85.7 | 1 | 2026-08-23 |
| 22 | Gemini 2.0 Flash Exp | 85.1 | 1 | 2026-06-05 | |
| 23 | Qwen3 VL 30B A3B Instruct | Alibaba | 85 | 1 | 2026-08-23 |
| 24 | MiMo VL RL 2508 (7B) | Xiaomi | 85 | 2 | 2026-06-05 |
| 25 | Qwen3 VL 4B (Reasoning) | Alibaba | 84.9 | 1 | 2026-08-23 |
| 26 | Qwen3 VL Thinking (8B) | Alibaba | 84.9 | 3 | 2026-08-23 |
| 27 | Gemma 3 27B | 84.5 | 1 | 2026-08-23 | |
| 28 | Gemma 3 12B | 84.2 | 1 | 2026-08-23 | |
| 29 | Qwen3 VL 4B Instruct | Alibaba | 84.1 | 1 | 2026-08-23 |
| 30 | MiniMax VL 01 | MiniMax | 83.3 | 1 | 2026-06-05 |
| 31 | Qwen2.5 Omni 7B | Alibaba | 83.2 | 1 | 2026-08-23 |
| 32 | InternVL-3.5 (8B) | OpenGVLab | 82.3 | 2 | 2026-06-05 |
| 33 | Phi 4 Multimodal Instruct | Microsoft | 82.3 | 1 | 2026-08-23 |
| 34 | InternVL-2-8B | OpenGVLab | 81.4 | 1 | 2026-08-24 |
| 35 | Gemini 1.5 Pro | 80.9 | 3 | 2026-08-24 | |
| 36 | Llama 3.2 Instruct 90B (Vision) | Meta | 78.9 | 1 | 2026-06-05 |
| 37 | Phi 3.5 Vision Instruct | Microsoft | 78.1 | 2 | 2026-08-24 |
| 38 | North-Micro-Vision-Instruct | Cohere | 77.5 | 1 | 2026-08-23 |
| 39 | InternVL-2-4B | OpenGVLab | 77.3 | 1 | 2026-08-24 |
| 40 | GPT-4o mini | OpenAI | 75.2 | 1 | 2026-08-24 |
| 41 | Gemma 3 4B | 74.8 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.