Skip to content
VECTOR WIREAI INTELLIGENCE
UTC
Pro Mode — raw scores, one benchmark under the lensthird-party eval harness
The field · 84 measured
098.5

84 models measured, most on the third-party eval harness. Claude Mythos 5 tops the board at 98.5.

84 measured·3 new this week·Lifecycle Updated Oct 8, 2026Score basis
#◆Vendor$/M in$/M out
Leader — ignites whiteField — fill cools with scoreBars show 0–98.5 · ◆ solid = first-party or better · outlined = arm's-length
01Claude Mythos 5Anthropic98.5VENDOR$10.0/M$50.0/M$0.305
02Gemini 3.8 Flash+2 altsGoogle98.5$0.75/M$3.8/M$0.023
03Gemini 3.1 Pro+2 altsGoogle98$2.0/M$12.0/M$0.071
04Claude Mythos 5.1Anthropic97.5VENDOR$10.0/M$50.0/M$0.308
05GPT-6 Astra+5 altsOpenAI97.5$10.0/M$50.0/M$0.308
06Claude Fable 5.1+6 altsAnthropic97.5VENDOR$10.0/M$50.0/M$0.308
07Claude Opus 5+4 altsAnthropic97.5VENDOR$5.0/M$25.0/M$0.154
08Claude Opus 5.5+4 altsAnthropic97.5$4.0/M$20.0/M$0.123
09GPT-5.6 Terra+4 altsOpenAI96.5$2.0/M$12.0/M$0.073
10GPT-5.6 Sol+6 altsOpenAI96.5$4.0/M$20.0/M$0.124
11GPT-6.1 Sol+4 altsOpenAI96.5$2.0/M$10.0/M$0.062
12Gemini 3 Deep Think+1 altGoogle96———
13Gemini 3.7 Flash+2 altsGoogle95.5$0.75/M$3.8/M$0.024
14GPT-6 Sol+5 altsOpenAI95.5$2.0/M$10.0/M$0.063
15GPT-5.5+3 altsOpenAI95$5.0/M$30.0/M$0.184
16GPT-5.5 Pro+1 altOpenAI95$30.0/M$180.0/M$1.105
17GPT-5.4 Pro+2 altsOpenAI94.5$30.0/M$180.0/M$1.111
18Kimi K3+2 altsMoonshot94.5$0.58/M$12.3/M$0.068
19DeepSeek-V4.1-FlashNEW+3 altsDeepSeek94.5$0.20/M$0.60/M$0.004
20GPT-5.4+5 altsOpenAI93.67$2.5/M$15.0/M$0.093
21Claude Opus 4.6+5 altsAnthropic93VENDOR$5.0/M$25.0/M$0.161
22Gemini 3.5 Flash+1 altGoogle92.5$1.5/M$9.0/M$0.057
23Claude Opus 4.8+4 altsAnthropic92.5VENDOR$5.0/M$25.0/M$0.162
24Claude Opus 4.7+5 altsAnthropic92VENDOR$5.0/M$25.0/M$0.163
25Gemini 3.6 Flash+3 altsGoogle91.167$0.75/M$3.8/M$0.025
26GLM 5.3 Flash+2 altsZ.ai91$0.15/M$0.50/M$0.004
27GPT-5.6 Luna+12 altsOpenAI90.667$0.20/M$1.2/M$0.008
28GPT-5.2 Pro+2 altsOpenAI90.5$21.0/M$168.0/M$1.044
29Grok 4.20SpaceXAI89.5$1.3/M$2.5/M$0.021
30Grok 4.7NEW+3 altsSpaceXAI89.5$2.0/M$6.0/M$0.045
31DeepSeek-V4-Flash+3 altsDeepSeek89$0.44/M$1.3/M$0.010
32Qwen3.8 27BNEW+3 altsAlibaba87.5$0.50/M$3.0/M$0.020
33Grok 4.6+3 altsSpaceXAI87$2.0/M$6.0/M$0.046
34GPT-6 Luna+5 altsOpenAI86.667$0.10/M$0.50/M$0.003
35GPT-5.2+4 altsOpenAI86.17$1.8/M$14.0/M$0.091
36Claude Sonnet 4.6+1 altAnthropic86$3.0/M$15.0/M$0.105
37Grok4.5+2 altsSpaceXAI85.67$2.0/M$6.0/M$0.047
38Gemini 3 Flash Preview+3 altsGoogle84.67$0.50/M$3.0/M$0.021
39Inkling-Small+7 altsThinking Machines84VENDOR$0.30/M$1.2/M$0.009
40Claude Opus 4.5+7 altsAnthropic82VENDOR$5.0/M$25.0/M$0.183
41Inkling+1 altThinking Machines79.5$0.95/M$4.0/M$0.031
42GLM-5.2Z.ai77$1.4/M$4.4/M$0.038
43Gemini 3 ProGoogle75$2.0/M$12.0/M$0.093
44GPT-5.1+3 altsOpenAI72.83$1.3/M$10.0/M$0.077
45GPT-5 ProOpenAI70.17$15.0/M$120.0/M$0.962
46Grok 4SpaceXAI66.67$3.0/M$15.0/M$0.135
47GPT-5+3 altsOpenAI65.67$1.3/M$10.0/M$0.086
48Kimi K2.5Moonshot65.33$0.45/M$2.3/M$0.021
49Claude Sonnet 4.5+4 altsAnthropic63.67$3.0/M$15.0/M$0.141
50GPT-5.4 mini+3 altsOpenAI63.67$0.75/M$4.5/M$0.041
51MiniMax M2.5MiniMax63.67$0.27/M$1.1/M$0.011
52O3+2 altsOpenAI60.83$2.0/M$8.0/M$0.082
53O3 Pro+2 altsOpenAI59.33$20.0/M$80.0/M$0.843
54O4 Mini+2 altsOpenAI58.67$1.1/M$4.4/M$0.047
55DeepSeek-V3.2DeepSeek57$0.28/M$0.42/M$0.006
56GPT-5 mini+3 altsOpenAI54.33$0.25/M$2.0/M$0.021
57Gemini 3.5 Flash Lite+3 altsGoogle53.5$0.30/M$2.5/M$0.026
58GPT-5.4 nano+3 altsOpenAI51.5$0.20/M$1.3/M$0.014
59Grok 4 FastSpaceXAI48.5$0.20/M$0.50/M$0.007
60Claude Haiku 4.5+4 altsAnthropic47.67$1.0/M$5.0/M$0.063
61GLM-5Z.ai44.67$1.0/M$3.2/M$0.047
62Claude Sonnet 4+3 altsAnthropic40$3.0/M$15.0/M$0.225
63Tiny Recursion Model (TRM)Bespoke40———
64Gemini 2.5 Pro+4 altsGoogle37$1.3/M$10.0/M$0.152
65Claude Opus 4+3 altsAnthropic35.67$15.0/M$75.0/M$1.262
66O3 Mini+2 altsOpenAI34.5$1.1/M$4.4/M$0.080
67Gemini 2.5 Flash+4 altsGoogle32.33$0.30/M$2.5/M$0.043
68Hierarchical Reasoning Model (HRM)Bespoke32———
69Claude 3.7 Sonnet+3 altsAnthropic28.6$3.0/M$15.0/M$0.315
70Codex MiniOpenAI27.33———
71GPT-5 nano+3 altsOpenAI16.67$0.05/M$0.40/M$0.013
72Grok 3 Mini ReasoningSpaceXAI16.5$0.30/M$0.50/M$0.024
73DeepSeek-R1DeepSeek15.8$2.0/M$4.0/M$0.190
74O1 MiniOpenAI14———
75Qwen3 235B A22B Instruct 2507Alibaba11$0.23/M$0.92/M$0.052
76GPT-4.5 PreviewOpenAI10.3———
77Magistral Medium 1+2 altsMistral6.12———
78GPT-4.1OpenAI5.5$2.0/M$8.0/M$0.909
79Grok 3SpaceXAI5.5$4.0/M$20.0/M$2.182
80Magistral SmallMistral5———
81GPT-4oOpenAI4.5$5.0/M$15.0/M$2.222
82Llama 4 MaverickMeta4.38$0.25/M$0.87/M$0.128
83GPT-4.1 miniOpenAI3.5$0.40/M$1.6/M$0.286
84GPT-4.1 nanoOpenAI0$0.10/M$0.40/M—
◆ solid = independently verified · aggregator attested · vendor attributed — outlined = cross-reference · source-attributed. Dimmed ◆ = confidence inferred. “+N alts” = alternate disclosures in the drawer with why-demoted. Prices per million tokens; $/point = input price ÷ score. Every row opens its model dossier.

Verification: 84 models scored · 75 independently verified · 9 vendor-reported · 0 with source disagreement. How these tiers are assigned