Across 24 models scored on CC-OCR, Qwen3.6 Plus leads at 83.4, ahead of Qwen3 VL 235B A22B Instruct at 82.2. The median tracked score is 79.8, and the field spans 68.1 to 83.4.
Data as of August 25, 2026| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba | 83.4 | 1 | 2026-08-25 |
| 2 | Qwen3 VL 235B A22B Instruct | Alibaba | 82.2 | 1 | 2026-08-25 |
| 3 | Qwen3.5 397B A17B | Alibaba | 82 | 1 | 2026-08-24 |
| 4 | Qwen3.6 35B A3B | Alibaba | 81.9 | 2 | 2026-08-25 |
| 5 | Qwen3.5 122B A10B | Alibaba | 81.8 | 1 | 2026-08-25 |
| 6 | Qwen3 VL 235B A22B Reasoning | Alibaba | 81.5 | 1 | 2026-08-25 |
| 7 | Qwen3.6 27B | Alibaba | 81.2 | 2 | 2026-08-25 |
| 8 | Qwen3.5 27B | Alibaba | 81 | 3 | 2026-08-25 |
| 9 | Qwen3.5 35B A3B | Alibaba | 80.7 | 2 | 2026-08-25 |
| 10 | Qwen3 VL 30B A3B Instruct | Alibaba | 80.7 | 1 | 2026-08-25 |
| 11 | Qwen3 VL 32B Instruct | Alibaba | 80.3 | 1 | 2026-08-25 |
| 12 | Qwen3 VL 8B Instruct | Alibaba | 79.9 | 1 | 2026-08-25 |
| 13 | Qwen2.5 VL 72B | Alibaba | 79.8 | 1 | 2026-08-25 |
| 14 | Qwen3 VL 30B A3B Reasoning | Alibaba | 77.8 | 1 | 2026-08-25 |
| 15 | Qwen2.5 VL 32B Instruct | Alibaba | 77.1 | 1 | 2026-08-25 |
| 16 | Qwen2.5 VL 32B | Alibaba | 77.1 | 1 | 2026-08-25 |
| 17 | Claude Opus 4.5 | Anthropic | 76.9 | 1 | 2026-08-24 |
| 18 | Qwen3 VL Thinking (8B) | Alibaba | 76.3 | 1 | 2026-08-25 |
| 19 | Qwen3 VL 4B Instruct | Alibaba | 76.2 | 1 | 2026-08-25 |
| 20 | Gemma 4 31B | 75.7 | 2 | 2026-08-24 | |
| 21 | Gemma 4 26B A4B | 74.5 | 1 | 2026-08-24 | |
| 22 | Qwen3 VL 4B (Reasoning) | Alibaba | 73.8 | 1 | 2026-08-25 |
| 23 | Qwen2 VL 72B Instruct | Alibaba | 68.7 | 1 | 2026-08-25 |
| 24 | Claude Sonnet 4.5 | Anthropic | 68.1 | 1 | 2026-08-24 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.