tau-bench — Unnumbered "TAU-bench"; DeepSeek-R1/MiniMax M1 card; version unclear vs TAU1/Tau2 — kept separate on precision grounds
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Sonnet 4.5 | Anthropic | 70 | 1 | 2026-08-23 |
| 2 | MiniMax M1 80K | MiniMax | 62 | 3 | 2026-08-23 |
| 3 | GLM-4.5-Air | Z.ai | 60.8 | 1 | 2026-08-23 |
| 4 | GLM-4.5 | Z.ai | 60.4 | 1 | 2026-08-23 |
| 5 | Qwen3 Coder 480B A35B Instruct | Alibaba | 60 | 1 | 2026-08-23 |
| 6 | Claude Sonnet 4 | Anthropic | 60 | 1 | 2026-08-23 |
| 7 | MiniMax M1 40K | MiniMax | 60 | 3 | 2026-08-23 |
| 8 | Claude 4 Opus | Anthropic | 59.6 | 3 | 2026-08-23 |
| 9 | Claude 3.7 Sonnet | Anthropic | 58.4 | 1 | 2026-08-23 |
| 10 | Claude Opus 4.1 | Anthropic | 56 | 1 | 2026-08-23 |
| 11 | DeepSeek-R1 | DeepSeek | 53.5 | 2 | 2026-06-05 |
| 12 | o3 | OpenAI | 52 | 2 | 2026-06-05 |
| 13 | Gemini 2.5 Pro Preview 06.05 (32k think) | 50 | 2 | 2026-06-05 | |
| 14 | GPT-4.5 Preview | OpenAI | 50 | 1 | 2026-08-23 |
| 15 | o1 | OpenAI | 50 | 1 | 2026-08-23 |
| 16 | GPT-4.1 | OpenAI | 49.4 | 1 | 2026-08-23 |
| 17 | o4-mini | OpenAI | 49.2 | 1 | 2026-08-23 |
| 18 | Qwen3 Next 80B A3B | Alibaba | 49 | 1 | 2026-08-23 |
| 19 | Claude 3.5 Sonnet | Anthropic | 46 | 1 | 2026-08-23 |
| 20 | Qwen3 Next 80B A3B Instruct | Alibaba | 44 | 1 | 2026-08-23 |
| 21 | GPT-4o | OpenAI | 42.8 | 1 | 2026-08-23 |
| 22 | GPT-4.1 mini | OpenAI | 36 | 1 | 2026-08-23 |
| 23 | Qwen3 235B A22B | Alibaba | 34.7 | 2 | 2026-06-05 |
| 24 | o3-mini | OpenAI | 32.4 | 1 | 2026-08-23 |
| 25 | Claude 3.5 Haiku | Anthropic | 22.8 | 1 | 2026-08-23 |
| 26 | GPT-4.1 nano | OpenAI | 14 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.