VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

τ²-Bench

39 models tracked

tau2-bench — Sierra tau2-bench, telecom domain; SAME track as τ²-Bench-Telecom per domain-anchor rule

#ModelVendorBest scoreRunsLast seen
1Claude Opus 4.5Anthropic98.242026-07-29
2Gemini 3 ProGoogle9852026-07-29
3Claude Sonnet 4.5Anthropic9842026-07-29
4DeepSeek-V3.2DeepSeek91102026-06-13
5GLM-5Z.ai89.722026-06-13
6Step 3.5 FlashStepFun88.232026-06-12
7GLM-4.7Z.ai87.462026-06-13
8MiniMax M2MiniMax8722026-06-06
9MiniMax M2.1MiniMax8742026-06-12
10GPT-5.2OpenAI85.522026-06-13
11Kimi K2.5Moonshot85.452026-06-13
12GPT-5OpenAI8522026-06-13
13GPT-5.1OpenAI82.712026-06-13
14MiMo V2 FlashXiaomi80.352026-06-13
15GLM-4.7-FlashZ.ai79.512026-05-16
16Gemma 4 31BGoogle76.9262026-06-06
17GLM-4.6Z.ai75.222026-06-13
18Kimi K2 (Reasoning)Moonshot74.372026-06-13
19Claude Opus 4.1Anthropic71.512026-07-29
20Gemma 4 12BGoogle69262026-07-17
21Gemma 4 26B A4BGoogle68.2262026-06-06
22Kimi K2 InstructMoonshot65.822026-06-15
23Claude Sonnet 4Anthropic6532026-06-15
24Claude 4 OpusAnthropic5722026-06-15
25Gemini 2.5 ProGoogle5412026-06-06
26Qwen3 30B A3BAlibaba4922026-06-13
27gpt-oss-20bOpenAI47.712026-06-13
28Gemma 4 E4BGoogle42.2312026-07-11
29DeepSeek-V3DeepSeek32.522026-06-15
30Gemma 4 E2BGoogle24.5352026-07-21
31Qwen3 235B A22BAlibaba22.122026-06-15
32LFM2.5-350MLiquid AI18.922026-08-09
33Gemma 3 27BGoogle16.2272026-07-10
34Qwen3.5 0.8BAlibaba14.312026-08-09
35Qwen3.5 0.8B (Instruct)Alibaba12.622026-08-09
36LFM2-350MLiquid AI10.822026-08-09
37Gemma 3 1B ITGoogle9.422026-08-09
38LFM2.5-230MLiquid AI5.312026-08-09
39Granite 4.0 350MIBM2.922026-08-09

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.