Skip to content
VECTOR WIREAI INTELLIGENCE
UTC
Pro Mode — raw scores, one benchmark under the lensthird-party eval harness
The field · 73 measured
25.3593.15

73 models measured, most on the third-party eval harness. Claude Haiku 4.5 tops the board at 93.15.

73 measured·Lifecycle Updated Oct 8, 2026Score basis
#◆Vendor$/M in$/M out
Leader — ignites whiteField — fill cools with scoreBars show 25.35–93.15 · ◆ solid = first-party or better · outlined = arm's-length
01Claude Haiku 4.5Anthropic93.15$1.0/M$5.0/M$0.032
02Claude Sonnet 4.5Anthropic89.84$3.0/M$15.0/M$0.100
03Claude Sonnet 4Anthropic88.27$3.0/M$15.0/M$0.102
04GPT Oss 120bOpenAI88$0.15/M$0.59/M$0.004
05MAI-Thinking-1Microsoft88VENDOR———
06GPT-5 nanoOpenAI87.82$0.05/M$0.40/M$0.003
07GPT-5OpenAI87.67$1.3/M$10.0/M$0.064
08Qwen3 Next 80B A3BAlibaba86.7$0.15/M$1.2/M$0.008
09GPT-5.1OpenAI86.19$1.3/M$10.0/M$0.065
10GPT Oss 20bOpenAI85.97$0.07/M$0.18/M$0.001
11Claude 3.5 SonnetAnthropic85.9$3.0/M$15.0/M$0.105
12Claude Opus 4Anthropic85.74$15.0/M$75.0/M$0.525
13GPT-5 miniOpenAI85.71$0.25/M$2.0/M$0.013
14Claude 3 SonnetAnthropic84.69———
15O3OpenAI84.47$2.0/M$8.0/M$0.059
16Claude 3 OpusAnthropic84.37$15.0/M$75.0/M$0.533
17Claude 3 HaikuAnthropic82.7$0.25/M$1.3/M$0.009
18Granite 3.3 8B InstructIBM82.52$0.03/M$0.25/M$0.002
19IBM Granite 4.0 SmallIBM82.05———
20Claude 3.7 SonnetAnthropic81.77$3.0/M$15.0/M$0.110
21Granite 4.0 MicroIBM80.39———
22O1OpenAI79.96$15.0/M$60.0/M$0.469
23Qwen3 235B A22B Instruct 2507Alibaba78.97$0.23/M$0.92/M$0.007
24O4 MiniOpenAI78.49$1.1/M$4.4/M$0.035
25Palmyra X5Writer78.17$0.60/M$6.0/M$0.042
26Seed Oss 36B InstructByteDance75.6$0.21/M$0.57/M$0.005
27O3 MiniOpenAI74.89$1.1/M$4.4/M$0.037
28GPT-4.5 PreviewOpenAI74.15———
29Kimi K2 InstructMoonshot74.11$0.57/M$2.3/M$0.019
30Gemini 2.5 ProGoogle73.59$1.3/M$10.0/M$0.076
31Gemini 3 ProGoogle73.21$2.0/M$12.0/M$0.096
32GPT-4 TurboOpenAI71.87$10.0/M$30.0/M$0.278
33Llama 3 Instruct 8BMeta70.92$0.04/M$0.14/M$0.001
34Gemini 2.5 FlashGoogle68.67$0.30/M$2.5/M$0.020
35Llama 4 Maverick 17B 128E Instruct FP8Meta68.6$0.27/M$0.85/M$0.008
36Gemini 2.0 Pro Exp 02.05Google68.4———
37Gemini 2.0 Flash (Non-Reasoning)Google67.46———
38Gemini 2.0 Flash Lite (02-05 preview)Google67.46———
39Gemini 1.5 Pro+1 altGoogle67.33———
40Gemini 1.5 Flash (001)+1 altGoogle67.11———
41Palmyra FinWriter66.25———
42Gemini 2.5 Flash LiteGoogle65.77$0.10/M$0.40/M$0.004
43GPT-4.1OpenAI64.79$2.0/M$8.0/M$0.077
44Llama 3 Instruct 70BMeta64.62$0.65/M$2.8/M$0.026
45GPT-4OpenAI64.17$30.0/M$60.0/M$0.701
46GPT-4o+1 altOpenAI62.35$5.0/M$15.0/M$0.160
47Llama 3.1 8B InstructMeta62.34$0.02/M$0.04/M$0.000
48Qwen2 Instruct (72B)Alibaba62.1———
49GPT-4.1 nanoOpenAI61.53$0.10/M$0.40/M$0.004
50GPT-4.1 miniOpenAI60.44$0.40/M$1.6/M$0.017
51Qwen2.5 Instruct 72BAlibaba58.97$0.47/M$0.49/M$0.008
52Llama 3.1 Instruct 405BMeta58.63———
53Palmyra MedWriter57.8———
54GLM-4.5-AirZ.ai57.09$0.17/M$0.98/M$0.010
55GPT-4o miniOpenAI56.26$0.15/M$0.60/M$0.007
56Qwen3 235B A22B FP8 ThroughputAlibaba56.03———
57Grok 3 Mini BetaSpaceXAI53.5$0.30/M$0.50/M$0.007
58DeepSeek-R1DeepSeek52.91$2.0/M$4.0/M$0.057
59Llama 4 ScoutMeta52.27$0.19/M$0.68/M$0.008
60Grok 3 BetaSpaceXAI51.34$3.0/M$15.0/M$0.175
61DeepSeek-LLM-67B-Chat (V1)DeepSeek50.54———
62Qwen2.5 Instruct Turbo (7B)Alibaba47.03———
63O1 MiniOpenAI45.25———
64Grok 4SpaceXAI44.38$3.0/M$15.0/M$0.203
65Palmyra-X-004Writer44.24———
66Llama 3.1 70B InstructMeta42.5$0.56/M$0.56/M$0.013
67DeepSeek-V3DeepSeek40.79$0.24/M$0.90/M$0.014
68Mistral Large 2Mistral35.26$2.0/M$6.0/M$0.113
69Mistral Small 3 (Non-Reasoning)Mistral32.75$0.05/M$0.08/M$0.002
70Mistral Instruct V0.3 (7B)Mistral32.55———
71Command RCohere31.8$0.15/M$0.60/M$0.012
72Command R+ (Apr '24)Cohere29.27$2.5/M$10.0/M$0.214
73DBRX InstructDatabricks25.35———
◆ solid = independently verified · aggregator attested · vendor attributed — outlined = cross-reference · source-attributed. Dimmed ◆ = confidence inferred. “+N alts” = alternate disclosures in the drawer with why-demoted. Prices per million tokens; $/point = input price ÷ score. Every row opens its model dossier.

Verification: 73 models scored · 71 independently verified · 2 vendor-reported · 0 with source disagreement. How these tiers are assigned