VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

TAU-bench (retail)

28 models tracked

tau-bench — Unnumbered "TAU-bench"; DeepSeek-R1/MiniMax M1 card; version unclear vs TAU1/Tau2

#ModelVendorBest scoreRunsLast seen
1Claude Sonnet 4.5Anthropic86.212026-08-23
2Claude Opus 4.1Anthropic82.412026-08-23
3Claude 4 OpusAnthropic81.432026-08-23
4Claude 3.7 SonnetAnthropic81.212026-08-23
5Claude Sonnet 4Anthropic80.512026-08-23
6GLM-4.5Z.ai79.712026-08-23
7GLM-4.5-AirZ.ai77.912026-08-23
8Qwen3 Coder 480B A35B InstructAlibaba77.512026-08-23
9o3OpenAI73.922026-06-05
10o4-miniOpenAI71.812026-08-23
11o1OpenAI70.812026-08-23
12Qwen3 Next 80B A3BAlibaba69.612026-08-23
13Claude 3.5 SonnetAnthropic69.212026-08-23
14GPT-4.5 PreviewOpenAI68.412026-08-23
15GPT-4.1OpenAI6812026-08-23
16GPT OSS 120BOpenAI67.812026-08-23
17MiniMax M1 40KMiniMax67.832026-08-23
18Gemini 2.5 Pro Preview 06.05 (32k think)Google6722026-06-05
19DeepSeek-R1DeepSeek63.922026-06-05
20MiniMax M1 80KMiniMax63.532026-08-23
21Qwen3 Next 80B A3B InstructAlibaba60.912026-08-23
22GPT-4oOpenAI60.312026-08-23
23Qwen3 235B A22BAlibaba58.622026-06-05
24o3-miniOpenAI57.612026-08-23
25GPT-4.1 miniOpenAI55.812026-08-23
26gpt-oss-20bOpenAI54.812026-08-23
27Claude 3.5 HaikuAnthropic5112026-08-23
28GPT-4.1 nanoOpenAI22.612026-08-23

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.