tau-bench — Unnumbered "TAU-bench"; DeepSeek-R1/MiniMax M1 card; version unclear vs TAU1/Tau2
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Sonnet 4.5 | Anthropic | 86.2 | 1 | 2026-08-23 |
| 2 | Claude Opus 4.1 | Anthropic | 82.4 | 1 | 2026-08-23 |
| 3 | Claude 4 Opus | Anthropic | 81.4 | 3 | 2026-08-23 |
| 4 | Claude 3.7 Sonnet | Anthropic | 81.2 | 1 | 2026-08-23 |
| 5 | Claude Sonnet 4 | Anthropic | 80.5 | 1 | 2026-08-23 |
| 6 | GLM-4.5 | Z.ai | 79.7 | 1 | 2026-08-23 |
| 7 | GLM-4.5-Air | Z.ai | 77.9 | 1 | 2026-08-23 |
| 8 | Qwen3 Coder 480B A35B Instruct | Alibaba | 77.5 | 1 | 2026-08-23 |
| 9 | o3 | OpenAI | 73.9 | 2 | 2026-06-05 |
| 10 | o4-mini | OpenAI | 71.8 | 1 | 2026-08-23 |
| 11 | o1 | OpenAI | 70.8 | 1 | 2026-08-23 |
| 12 | Qwen3 Next 80B A3B | Alibaba | 69.6 | 1 | 2026-08-23 |
| 13 | Claude 3.5 Sonnet | Anthropic | 69.2 | 1 | 2026-08-23 |
| 14 | GPT-4.5 Preview | OpenAI | 68.4 | 1 | 2026-08-23 |
| 15 | GPT-4.1 | OpenAI | 68 | 1 | 2026-08-23 |
| 16 | GPT OSS 120B | OpenAI | 67.8 | 1 | 2026-08-23 |
| 17 | MiniMax M1 40K | MiniMax | 67.8 | 3 | 2026-08-23 |
| 18 | Gemini 2.5 Pro Preview 06.05 (32k think) | 67 | 2 | 2026-06-05 | |
| 19 | DeepSeek-R1 | DeepSeek | 63.9 | 2 | 2026-06-05 |
| 20 | MiniMax M1 80K | MiniMax | 63.5 | 3 | 2026-08-23 |
| 21 | Qwen3 Next 80B A3B Instruct | Alibaba | 60.9 | 1 | 2026-08-23 |
| 22 | GPT-4o | OpenAI | 60.3 | 1 | 2026-08-23 |
| 23 | Qwen3 235B A22B | Alibaba | 58.6 | 2 | 2026-06-05 |
| 24 | o3-mini | OpenAI | 57.6 | 1 | 2026-08-23 |
| 25 | GPT-4.1 mini | OpenAI | 55.8 | 1 | 2026-08-23 |
| 26 | gpt-oss-20b | OpenAI | 54.8 | 1 | 2026-08-23 |
| 27 | Claude 3.5 Haiku | Anthropic | 51 | 1 | 2026-08-23 |
| 28 | GPT-4.1 nano | OpenAI | 22.6 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.