OmniDocBench 1.5 — Document-parsing benchmark v1.5; ~82-88.8 band is percentage-style, diff metric.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | MiniMax M3 | MiniMax | 91.6 | 1 | 2026-08-23 |
| 2 | Qwen3.7 Plus Preview | Alibaba | 91.4 | 2 | 2026-08-24 |
| 3 | Qwen3.6 Plus | Alibaba | 91.2 | 1 | 2026-08-23 |
| 4 | Qwen3.8 27B | Alibaba | 91.1 | 2 | 2026-08-24 |
| 5 | Qwen3.6 35B A3B | Alibaba | 89.9 | 2 | 2026-08-24 |
| 6 | Qwen3.5 122B A10B | Alibaba | 89.8 | 1 | 2026-08-23 |
| 7 | Qwen3.6 27B | Alibaba | 89.4 | 1 | 2026-08-24 |
| 8 | Qwen3.5 35B A3B | Alibaba | 89.3 | 2 | 2026-08-24 |
| 9 | GPT-5.4 | OpenAI | 89.1 | 1 | 2026-08-23 |
| 10 | Qwen3.5 27B | Alibaba | 88.9 | 2 | 2026-08-24 |
| 11 | Kimi K2.5 | Moonshot | 88.8 | 2 | 2026-08-23 |
| 12 | Gemini 3 Pro | 88.5 | 2 | 2026-08-23 | |
| 13 | Claude Opus 4.5 | Anthropic | 87.7 | 1 | 2026-06-15 |
| 14 | GPT-5.5 Instant | OpenAI | 87.5 | 1 | 2026-08-23 |
| 15 | GPT-5.4 mini | OpenAI | 87.4 | 1 | 2026-08-23 |
| 16 | Claude Opus 4.6 | Anthropic | 86.6 | 1 | 2026-08-24 |
| 17 | Claude Sonnet 4.5 | Anthropic | 85.8 | 1 | 2026-08-24 |
| 18 | GPT-5.2 | OpenAI | 85.7 | 1 | 2026-06-15 |
| 19 | Qwen3 VL 235B A22B Reasoning | Alibaba | 82 | 1 | 2026-06-15 |
| 20 | Gemma 4 31B | 80.1 | 1 | 2026-08-24 | |
| 21 | GPT-5.4 nano | OpenAI | 75.8 | 1 | 2026-08-23 |
| 22 | muse-glimmer-30b | Meta | 75.8 | 2 | 2026-08-24 |
| 23 | Gemma 4 26B A4B | 74.4 | 1 | 2026-08-24 | |
| 24 | Gemma 4 12B | 16.4 | 1 | 2026-08-23 | |
| 25 | Gemini 3 Flash Preview | 12.1 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.