INCLUDE (multilingual knowledge/reasoning benchmark) — Real published multilingual benchmark, lowercase raw name in DeepSeek/IBM cards.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 | Anthropic | 87.6 | 1 | 2026-08-23 |
| 2 | Qwen3.7 Max | Alibaba | 86.2 | 1 | 2026-08-23 |
| 3 | Qwen3.5 397B A17B | Alibaba | 85.6 | 1 | 2026-08-23 |
| 4 | Qwen3.6 Plus | Alibaba | 85.1 | 1 | 2026-08-23 |
| 5 | Qwen3.7 Plus Preview | Alibaba | 83 | 1 | 2026-08-23 |
| 6 | Qwen3.5 122B A10B | Alibaba | 82.8 | 1 | 2026-08-23 |
| 7 | Qwen3.5 27B | Alibaba | 81.6 | 1 | 2026-08-23 |
| 8 | Qwen3 VL 235B A22B Reasoning | Alibaba | 80 | 1 | 2026-08-23 |
| 9 | Qwen3 VL 235B A22B Instruct | Alibaba | 80 | 1 | 2026-08-23 |
| 10 | Qwen3.5 35B A3B | Alibaba | 79.7 | 1 | 2026-08-23 |
| 11 | Qwen3 235B A22B Instruct 2507 | Alibaba | 79.5 | 1 | 2026-08-23 |
| 12 | Qwen3 Next 80B A3B | Alibaba | 78.9 | 1 | 2026-08-23 |
| 13 | Qwen3 Next 80B A3B Instruct | Alibaba | 78.9 | 1 | 2026-08-23 |
| 14 | Hy3 preview-Base | Tencent | 78.6 | 2 | 2026-06-05 |
| 15 | DeepSeek-V3-Base | DeepSeek | 77.9 | 2 | 2026-06-05 |
| 16 | DeepSeek-V3.2-Exp-Base | DeepSeek | 77.2 | 2 | 2026-06-13 |
| 17 | DeepSeek-V3.1-Base | DeepSeek | 77.2 | 2 | 2026-06-13 |
| 18 | Qwen3 VL 32B Reasoning | Alibaba | 76.3 | 1 | 2026-08-23 |
| 19 | GLM-4.5-Base | Z.ai | 76.3 | 2 | 2026-06-05 |
| 20 | Kimi K2 Base | Moonshot | 75.7 | 4 | 2026-06-13 |
| 21 | Qwen3.5 9B | Alibaba | 75.6 | 1 | 2026-08-23 |
| 22 | Qwen3 VL 30B A3B Reasoning | Alibaba | 74.5 | 1 | 2026-08-23 |
| 23 | Qwen3 VL 32B Instruct | Alibaba | 74 | 1 | 2026-08-23 |
| 24 | Qwen3 235B A22B | Alibaba | 73.5 | 1 | 2026-08-23 |
| 25 | Qwen3 VL 30B A3B Instruct | Alibaba | 71.6 | 1 | 2026-08-23 |
| 26 | MiMo V2 Flash Base | Xiaomi | 71.4 | 2 | 2026-06-13 |
| 27 | Qwen3.5 4B | Alibaba | 71 | 1 | 2026-08-23 |
| 28 | Qwen3 VL Thinking (8B) | Alibaba | 69.5 | 1 | 2026-08-23 |
| 29 | Granite 4.1 30B | IBM | 67.3 | 1 | 2026-06-15 |
| 30 | Granite 4.1 30B Base | IBM | 67.1 | 2 | 2026-06-15 |
| 31 | Qwen3 VL 8B Instruct | Alibaba | 67 | 1 | 2026-08-23 |
| 32 | Qwen3 VL 4B (Reasoning) | Alibaba | 64.6 | 1 | 2026-08-23 |
| 33 | Qwen3 VL 4B Instruct | Alibaba | 61.4 | 1 | 2026-08-23 |
| 34 | Granite 4.1 8B | IBM | 58.9 | 1 | 2026-06-15 |
| 35 | Granite 4.1 8B Base | IBM | 57.6 | 2 | 2026-06-15 |
| 36 | Qwen3.5 2B | Alibaba | 55.4 | 1 | 2026-08-23 |
| 37 | Granite 4.1 3B Base | IBM | 51.8 | 1 | 2026-06-15 |
| 38 | Qwen2.5 3B Base | Alibaba | 49.1 | 1 | 2026-05-03 |
| 39 | Qwen2.5 7B Base | Alibaba | 45.9 | 1 | 2026-05-03 |
| 40 | Qwen3.5 0.8B | Alibaba | 40.6 | 1 | 2026-08-23 |
| 41 | Qwen3 4B Base Dense | Alibaba | 34.3 | 1 | 2026-05-03 |
| 42 | Gemma 3 1B Base Dense | 25.6 | 1 | 2026-05-03 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.