tau2-bench — Sierra tau2-bench, telecom domain; SAME track as τ²-Bench-Telecom per domain-anchor rule
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.5 | Anthropic | 98.2 | 4 | 2026-07-29 |
| 2 | Gemini 3 Pro | 98 | 5 | 2026-07-29 | |
| 3 | Claude Sonnet 4.5 | Anthropic | 98 | 4 | 2026-07-29 |
| 4 | DeepSeek-V3.2 | DeepSeek | 91 | 10 | 2026-06-13 |
| 5 | GLM-5 | Z.ai | 89.7 | 2 | 2026-06-13 |
| 6 | Step 3.5 Flash | StepFun | 88.2 | 3 | 2026-06-12 |
| 7 | GLM-4.7 | Z.ai | 87.4 | 6 | 2026-06-13 |
| 8 | MiniMax M2 | MiniMax | 87 | 2 | 2026-06-06 |
| 9 | MiniMax M2.1 | MiniMax | 87 | 4 | 2026-06-12 |
| 10 | GPT-5.2 | OpenAI | 85.5 | 2 | 2026-06-13 |
| 11 | Kimi K2.5 | Moonshot | 85.4 | 5 | 2026-06-13 |
| 12 | GPT-5 | OpenAI | 85 | 2 | 2026-06-13 |
| 13 | GPT-5.1 | OpenAI | 82.7 | 1 | 2026-06-13 |
| 14 | MiMo V2 Flash | Xiaomi | 80.3 | 5 | 2026-06-13 |
| 15 | GLM-4.7-Flash | Z.ai | 79.5 | 1 | 2026-05-16 |
| 16 | Gemma 4 31B | 76.9 | 26 | 2026-06-06 | |
| 17 | GLM-4.6 | Z.ai | 75.2 | 2 | 2026-06-13 |
| 18 | Kimi K2 (Reasoning) | Moonshot | 74.3 | 7 | 2026-06-13 |
| 19 | Claude Opus 4.1 | Anthropic | 71.5 | 1 | 2026-07-29 |
| 20 | Gemma 4 12B | 69 | 26 | 2026-07-17 | |
| 21 | Gemma 4 26B A4B | 68.2 | 26 | 2026-06-06 | |
| 22 | Kimi K2 Instruct | Moonshot | 65.8 | 2 | 2026-06-15 |
| 23 | Claude Sonnet 4 | Anthropic | 65 | 3 | 2026-06-15 |
| 24 | Claude 4 Opus | Anthropic | 57 | 2 | 2026-06-15 |
| 25 | Gemini 2.5 Pro | 54 | 1 | 2026-06-06 | |
| 26 | Qwen3 30B A3B | Alibaba | 49 | 2 | 2026-06-13 |
| 27 | gpt-oss-20b | OpenAI | 47.7 | 1 | 2026-06-13 |
| 28 | Gemma 4 E4B | 42.2 | 31 | 2026-07-11 | |
| 29 | DeepSeek-V3 | DeepSeek | 32.5 | 2 | 2026-06-15 |
| 30 | Gemma 4 E2B | 24.5 | 35 | 2026-07-21 | |
| 31 | Qwen3 235B A22B | Alibaba | 22.1 | 2 | 2026-06-15 |
| 32 | LFM2.5-350M | Liquid AI | 18.9 | 2 | 2026-08-09 |
| 33 | Gemma 3 27B | 16.2 | 27 | 2026-07-10 | |
| 34 | Qwen3.5 0.8B | Alibaba | 14.3 | 1 | 2026-08-09 |
| 35 | Qwen3.5 0.8B (Instruct) | Alibaba | 12.6 | 2 | 2026-08-09 |
| 36 | LFM2-350M | Liquid AI | 10.8 | 2 | 2026-08-09 |
| 37 | Gemma 3 1B IT | 9.4 | 2 | 2026-08-09 | |
| 38 | LFM2.5-230M | Liquid AI | 5.3 | 1 | 2026-08-09 |
| 39 | Granite 4.0 350M | IBM | 2.9 | 2 | 2026-08-09 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.