Skip to content
VECTOR WIREAI INTELLIGENCE
UTC
Pro Mode — raw scores, one benchmark under the lensthird-party eval harness
The field · 45 measured
74.396.9

45 models measured, most on the third-party eval harness. GLM-5 tops the board at 96.9.

45 measured·Lifecycle Updated Oct 8, 2026Score basis
#◆Vendor$/M in$/M out
Leader — ignites whiteField — fill cools with scoreBars show 74.3–96.9 · ◆ solid = first-party or better · outlined = arm's-length
01GLM-5+2 altsZ.ai96.9VENDOR$1.0/M$3.2/M$0.022
02Claude Opus 4.8+1 altAnthropic96.5VENDOR$5.0/M$25.0/M$0.155
03GPT-5.5+1 altOpenAI96.5VENDOR$5.0/M$30.0/M$0.181
04Claude Opus 4.6+1 altAnthropic96.3VENDOR$5.0/M$25.0/M$0.156
05GPT-5.2+1 altOpenAI95.833$1.8/M$14.0/M$0.082
06GPT-5.4+1 altOpenAI95.8VENDOR$2.5/M$15.0/M$0.091
07Qwen3.7 Max+1 altAlibaba95VENDOR$2.5/M$7.5/M$0.053
08Gemini 3.1 Pro+3 altsGoogle94.8VENDOR$2.0/M$12.0/M$0.074
09Qwen3.6 Plus+1 altAlibaba94.6VENDOR$0.50/M$3.0/M$0.018
10DeepSeek-V4-Pro+1 altDeepSeek94.4VENDOR$0.43/M$0.87/M$0.007
11GLM-5.2+2 altsZ.ai94.4VENDOR$1.4/M$4.4/M$0.031
12Step 3.5 Flash+3 altsStepFun94VENDOR$0.10/M$0.30/M$0.002
13GLM-5.1+3 altsZ.ai94VENDOR$1.4/M$4.4/M$0.031
14GLM-4.7+3 altsZ.ai93.5$0.60/M$2.2/M$0.015
15Grok 4.1 FastSpaceXAI93.333$0.20/M$0.50/M$0.004
16DeepSeek-V3.2-SpecialeDeepSeek93.333$0.29/M$0.43/M$0.004
17Gemini 3 Flash PreviewGoogle93.333$0.50/M$3.0/M$0.019
18Gemini 3 Pro+2 altsGoogle93.333$2.0/M$12.0/M$0.075
19Claude Opus 4.5Anthropic93.3$5.0/M$25.0/M$0.161
20Qwen3.5 397B A17BAlibaba92.7$0.60/M$3.6/M$0.023
21GLM-4.6+1 altZ.ai91.667$0.57/M$2.2/M$0.015
22GPT-5.1+1 altOpenAI91.667$1.3/M$10.0/M$0.061
23MiMo V2 Flash+2 altsXiaomi91VENDOR$0.10/M$0.30/M$0.002
24Grok 4 Fast RSpaceXAI90.833———
25Qwen3.6 27BAlibaba90.7$0.60/M$3.6/M$0.023
26DeepSeek-V3.2+6 altsDeepSeek90$0.28/M$0.42/M$0.004
27GPT Oss 120bOpenAI90$0.15/M$0.59/M$0.004
28Qwen3.5 27B+1 altAlibaba89.8$0.30/M$2.4/M$0.015
29Qwen3.5 35B A3BAlibaba89.2$0.25/M$2.0/M$0.013
30Kimi K2.5+2 altsMoonshot89.167$0.45/M$2.3/M$0.015
31Kimi K2 Thinking+4 altsMoonshot89.167$0.60/M$2.5/M$0.017
32GPT-5+1 altOpenAI89.167$1.3/M$10.0/M$0.063
33Qwen3.6 35B A3B+1 altAlibaba89.1$0.38/M$2.3/M$0.015
34Grok 4SpaceXAI88.333$3.0/M$15.0/M$0.102
35Gemma 4 26B A4BGoogle87.5$0.07/M$0.34/M$0.002
36Gemma 4 31B+1 altGoogle87.5$0.17/M$0.40/M$0.003
37MiniMax M3+1 altMiniMax84.4VENDOR$0.28/M$1.1/M$0.008
38GPT-5 miniOpenAI84.167$0.25/M$2.0/M$0.013
39DeepSeek-V3.2-ExpDeepSeek84.167$0.28/M$0.42/M$0.004
40Claude Sonnet 4.5Anthropic81.7$3.0/M$15.0/M$0.110
41GPT-5 nanoOpenAI81.667$0.05/M$0.40/M$0.003
42MiniMax M2.7+1 altMiniMax81VENDOR$0.21/M$0.84/M$0.006
43Gemini 2.5 ProGoogle80$1.3/M$10.0/M$0.070
44QED-NanoLM-Provers75———
45MiniMax M2.1+2 altsMiniMax74.3VENDOR$0.30/M$1.2/M$0.010
◆ solid = independently verified · aggregator attested · vendor attributed — outlined = cross-reference · source-attributed. Dimmed ◆ = confidence inferred. “+N alts” = alternate disclosures in the drawer with why-demoted. Prices per million tokens; $/point = input price ÷ score. Every row opens its model dossier.

Verification: 45 models scored · 19 independently verified · 10 vendor cross-reference · 16 vendor-reported · 0 with source disagreement. How these tiers are assigned