Skip to content
VECTOR WIREAI INTELLIGENCE
UTC

τ²-Bench Telecom (AA run) leaderboard — the family board.

20 TRACKED VARIANTS · 13 FIRST-CLASS BOARDS

One family, 20 tracked prints: TauBench V3 - Banking, τ²-Bench, τ²-Bench (Retail), τ³-Bench Banking, TAU-bench (retail), TAU-bench (airline), Tau2 airline, τ³-Bench, Tau² Telecom, TauBench V3 - Airline, TauBench V3 - Retail and TauBench V3 - Telecom are cited standalone and keep live boards of their own. Scoring configs and splits of the base board render as sections of this page, each under its own honest label.

● LIVE DATA295 MODELS ON THIS BOARDLEADER CLAUDE OPUS 4.6 AT 99.3

First-class boards in this familyCITED STANDALONE · EACH KEEPS ITS OWN LIVE BOARD

The board — τ²-Bench Telecom (AA run)TOP 100 OF 295 MEASURED · BEST SCORE PER MODEL, DEFAULT VARIANT

#ModelVendorScoreVLast seen
01Claude Opus 4.6Anthropic99.32026-10-04
02Gemini 3.1 ProGoogle99.32026-05-02
03GLM-5.2Z.ai99.12026-06-17
04JT-35B-FlashChina Mobile99.12026-05-13
05GLM-4.7-FlashZ.ai98.82026-06-01
06GPT-5.2OpenAI98.72026-05-02
07GLM 5V TurboZ.ai98.52026-06-01
08Claude Fable 5Anthropic98.52026-10-04
09Step 3.7 FlashStepFun98.52026-06-02
10GLM-5-TurboZ.ai98.52026-05-02
11GLM-5Z.ai98.22026-05-02
12Gemini 3 ProGoogle982026-05-02
13Claude Sonnet 4.6Anthropic97.92026-10-04
14Grok 4.3SpaceXAI97.72026-05-23
15Qwen3.6 PlusAlibaba97.72026-05-02
16GLM-5.1Z.ai97.72026-05-02
17Grok 4.20SpaceXAI96.52026-09-10
18DeepSeek-V4-ProDeepSeek96.22026-10-01
19GLM-4.7Z.ai95.92026-06-01
20Kimi K2.6Moonshot95.92026-05-02
21Qwen3.6 Max PreviewAlibaba95.92026-05-02
22Kimi K2.5Moonshot95.92026-06-01
23Qwen3.5 397B A17BAlibaba95.62026-06-01
24DeepSeek-V4-FlashDeepSeek95.62026-10-01
25Gemini 3.5 FlashGoogle95.62026-09-10
26MiniMax M2.5MiniMax95.32026-05-02
27Qwen3.6 35B A3BAlibaba95.32026-06-01
28MiMo V2 FlashXiaomi95.02026-05-06
29MiMo V2 ProXiaomi95.02026-05-02
30Qwen3.7 MaxAlibaba94.72026-05-20
31Step 3.5 FlashStepFun94.42026-06-18
32Claude Opus 4.8Anthropic94.42026-10-04
33MiMo V2.5 ProXiaomi94.22026-09-22
34Mistral Medium 3.5 128BMistral94.22026-05-02
35Qwen3.6 27BAlibaba94.22026-05-02
36Qwen3.5 27BAlibaba93.92026-05-02
37GPT-5.5OpenAI93.92026-06-01
38Qwen3.5 122B A10BAlibaba93.62026-05-02
39Grok 4.1 FastSpaceXAI93.32026-06-23
40Qwen3.7 Plus PreviewAlibaba93.02026-06-04
41JT-MINIChina Mobile93.02026-05-02
42Kimi K2 ThinkingMoonshot93.02026-05-02
43Nova 2.0 Pro PreviewAmazon92.72026-05-02
44Qwen3.5 4BAlibaba92.12026-05-02
45GPT-5.2 CodexOpenAI92.12026-05-02
46Muse SparkMeta91.52026-05-02
47MiMo V2 OmniXiaomi91.22026-05-02
48DeepSeek-V3.2DeepSeek90.62026-05-02
49MiMo V2.5Xiaomi90.62026-09-24
50Grok 3 Mini ReasoningSpaceXAI90.42026-06-01
51Kimi K2.7 CodeMoonshot90.12026-06-17
52Trinity Large ThinkingArcee AI90.12026-05-02
53ling-2-6-1tInclusionAI89.82026-05-02
54Claude Opus 4.5Anthropic89.52026-05-06
55Qwen3.5 35B A3BAlibaba89.22026-05-02
56MiniMax M3MiniMax88.92026-06-04
57Claude Opus 4.7Anthropic88.62026-10-04
58Qwen3.5 Omni PlusAlibaba88.32026-05-02
59MiniCPM-V 4.6 1.3BOpenBMB87.72026-05-12
60HyperCLOVA X SEED Think (32B)Naver87.42026-07-03
61GPT-5.4OpenAI87.12026-05-02
62GPT-5 CodexOpenAI86.82026-05-02
63MiniMax M2MiniMax86.82026-05-02
64Qwen3.5 9BAlibaba86.82026-05-02
65Mi:dm K 2.5 ProKorea Telecom86.52026-09-22
66GPT-5OpenAI86.52026-06-21
67Solar Pro 3Upstage86.32026-05-02
68GPT-5.6 TerraOpenAI86.32026-07-10
69Ling 2.6 FlashInclusionAI86.02026-05-02
70GPT-5.3 CodexOpenAI86.02026-05-02
71MiniMax M2.1MiniMax85.42026-05-02
72GPT-5.6 SolOpenAI85.12026-07-10
73MiniMax M2.7MiniMax84.82026-05-02
74Qwen3.5 Omni FlashAlibaba84.52026-05-02
75ERNIE 5.0 Thinking PreviewBaidu83.92026-05-02
76Qwen3 Max (Reasoning)Alibaba83.62026-09-22
77GPT-5.4 miniOpenAI83.32026-06-01
78Nemotron 3 Ultra 550B A55BNVIDIA83.32026-06-06
79GPT-5.1 CodexOpenAI83.02026-05-02
80MiniCPM5-1BOpenBMB82.52026-06-05
81GPT-5.1OpenAI81.92026-06-20
82Nex-N2-ProNex AGI81.62026-06-26
83Qwen3.5 2BAlibaba81.62026-05-02
84Tri-21B-ThinkTrillion Labs81.02026-09-22
85Command A+Cohere80.72026-06-19
86o3OpenAI80.72026-05-02
87Gemini 3 Flash PreviewGoogle80.42026-05-02
88Nova 2.0 Omni Reasoning MediumAmazon80.42026-06-01
89Qwen3 Coder NextAlibaba79.52026-05-02
90LongCat Flash LiteMeituan79.52026-05-02
91EXAONE 4.5 33BLG AI78.12026-05-02
92Claude Sonnet 4.5Anthropic78.12026-06-01
93GLM-4.6Z.ai76.92026-06-19
94GPT-5.4 nanoOpenAI76.02026-09-10
95Grok Code Fast 1SpaceXAI75.72026-05-02
96Nova 2.0 LiteAmazon75.72026-06-01
97Grok 4SpaceXAI74.92026-05-02
98K-EXAONELG AI74.32026-05-02
99Qwen3 Max (Non-Reasoning)Alibaba74.32026-05-02
100Claude Opus 4Anthropic73.42026-06-01
◆ IV — INDEPENDENTLY VERIFIED · ◆ AA — AGGREGATOR · ◆ VA — VENDOR · ◇ SA — SOURCE-ATTRIBUTED

Variants of this boardSCORING CONFIGS & SPLITS — NOT CITED STANDALONE, SO THEY LIVE HERE

TauBench V3 - Average

VARIANT7 models · best score per model
#ModelVendorScoreVLast seen
01DeepSeek-V4-FlashDeepSeek73.72026-06-06
02DeepSeek-V4-ProDeepSeek73.22026-06-06
03Kimi K2.6Moonshot72.42026-06-06
04Qwen3.5 397B A17BAlibaba712026-06-06
05Nemotron 3 Ultra 550B A55BNVIDIA70.92026-09-01
06GLM-5.1Z.ai69.72026-06-06
07MiniMax M2.7MiniMax66.12026-06-06

Other tracked prints

THIN BOARDSunder 5 published models each — listed, never hidden
PrintLeaderScoreModels
TauBench V2 AverageNemotron 3 Super 120B A12B60.82

Also tracked, no published surface rows yet: τ³-bench (AVG) · Tau 3 Banking · TAU1-Airline · TAU1-Retail · Tau2 retail

THE FAMILY BOARD · EVERY PRINT LABELED · EVERY SCORE SOURCE-ATTRIBUTED ON ITS OWN LIVE BOARDAll leaderboardsThe frontier boardModels by vendor