LongBench v2 — Generic overall bucket (25 models, DeepSeek/MiniMax M1). Not merged w/ CoT-split entries.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.8 | Anthropic | 69.1 | 1 | 2026-08-24 |
| 2 | Qwen 3.5 397B 17B | Alibaba | 68.9 | 1 | 2026-06-10 |
| 3 | Gemini 3 Pro | 68.2 | 3 | 2026-06-15 | |
| 4 | GPT-5.6 Sol | OpenAI | 67.1 | 1 | 2026-08-24 |
| 5 | Qwen3.8 Max Preview | Alibaba | 66.3 | 2 | 2026-08-24 |
| 6 | Qwen3.7 Max | Alibaba | 65.3 | 1 | 2026-08-24 |
| 7 | Gemini 2.5 Pro Preview 06.05 (32k think) | 65 | 2 | 2026-06-05 | |
| 8 | Claude Opus 4.5 | Anthropic | 64.4 | 1 | 2026-06-15 |
| 9 | Qwen3.5 397B A17B | Alibaba | 63.2 | 1 | 2026-08-23 |
| 10 | Qwen3.6 Plus | Alibaba | 62 | 1 | 2026-08-23 |
| 11 | Nemotron 3 Ultra 550B A55B | NVIDIA | 61.9 | 1 | 2026-06-10 |
| 12 | nvidia-nemotron-3-ultra-550b-a55b | NVIDIA | 61.9 | 1 | 2026-08-24 |
| 13 | Claude Sonnet 4.5 | Anthropic | 61.8 | 1 | 2026-06-06 |
| 14 | MiniMax M1 80K | MiniMax | 61.5 | 3 | 2026-08-23 |
| 15 | MAI-Thinking-1 | Microsoft | 61 | 1 | 2026-08-23 |
| 16 | Kimi K2.5 | Moonshot | 61 | 2 | 2026-08-23 |
| 17 | MiniMax M1 40K | MiniMax | 61 | 3 | 2026-08-23 |
| 18 | MiMo V2 Flash | Xiaomi | 60.6 | 3 | 2026-08-23 |
| 19 | Qwen3.5 27B | Alibaba | 60.6 | 1 | 2026-08-23 |
| 20 | Qwen3.5 122B A10B | Alibaba | 60.2 | 1 | 2026-08-23 |
| 21 | DeepSeek-V3.2 | DeepSeek | 59.8 | 3 | 2026-06-15 |
| 22 | Qwen3.5 35B A3B | Alibaba | 59 | 1 | 2026-08-23 |
| 23 | o3 | OpenAI | 58.8 | 2 | 2026-06-05 |
| 24 | DeepSeek-R1 | DeepSeek | 58.3 | 4 | 2026-06-05 |
| 25 | Claude 4 Opus | Anthropic | 55.6 | 2 | 2026-06-05 |
| 26 | Qwen3.5 9B | Alibaba | 55.2 | 1 | 2026-08-23 |
| 27 | GPT-5.2 | OpenAI | 54.5 | 1 | 2026-06-15 |
| 28 | Qwen3 235B A22B | Alibaba | 50.1 | 2 | 2026-06-05 |
| 29 | Qwen3.5 4B | Alibaba | 50 | 1 | 2026-08-23 |
| 30 | DeepSeek-V3 | DeepSeek | 48.7 | 2 | 2026-08-23 |
| 31 | GPT-4o | OpenAI | 48.1 | 1 | 2026-05-03 |
| 32 | Kimi K2 (Reasoning) | Moonshot | 45.1 | 2 | 2026-06-13 |
| 33 | Claude 3.5 Sonnet | Anthropic | 41 | 1 | 2026-05-03 |
| 34 | Qwen2.5 Instruct 72B | Alibaba | 39.4 | 1 | 2026-05-03 |
| 35 | Qwen3.5 2B | Alibaba | 38.7 | 1 | 2026-08-23 |
| 36 | Llama 3.1 Instruct 405B | Meta | 36.1 | 1 | 2026-05-03 |
| 37 | DeepSeek-V2.5 | DeepSeek | 35.4 | 1 | 2026-05-03 |
| 38 | DeepSeek-V2 | DeepSeek | 31.6 | 1 | 2026-05-03 |
| 39 | Qwen3.5 0.8B | Alibaba | 26.1 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.