Skip to content
VECTOR WIREAI INTELLIGENCE
UTC
Pro Mode — raw scores, one benchmark under the lensthird-party eval harness
The field · 74 measured
71.0599.96

74 models measured, most on the third-party eval harness. Claude 3 Haiku tops the board at 99.96.

74 measured·Lifecycle Updated Oct 8, 2026Score basis
#◆Vendor$/M in$/M out
Leader — ignites whiteField — fill cools with scoreBars show 71.05–99.96 · ◆ solid = first-party or better · outlined = arm's-length
01Claude 3 HaikuAnthropic99.96$0.25/M$1.3/M$0.008
02Gemini 1.5 ProGoogle99.93———
03Gemini 1.5 Flash (001)Google99.93———
04Qwen3 Next 80B A3BAlibaba99.9$0.15/M$1.2/M$0.007
05Qwen3 235B A22B Instruct 2507Alibaba99.86$0.23/M$0.92/M$0.006
06IBM Granite 4.0 SmallIBM99.85———
07Claude 3 SonnetAnthropic99.84———
08Claude 3 OpusAnthropic99.79$15.0/M$75.0/M$0.451
09Claude 3.5 SonnetAnthropic99.78$3.0/M$15.0/M$0.090
10GPT-4 TurboOpenAI99.68$10.0/M$30.0/M$0.201
11Claude 3.7 SonnetAnthropic99.66$3.0/M$15.0/M$0.090
12GPT Oss 20bOpenAI99.65$0.07/M$0.18/M$0.001
13Granite 4.0 MicroIBM99.64———
14GPT-4.1 nanoOpenAI99.58$0.10/M$0.40/M$0.003
15Qwen2.5 Instruct 72BAlibaba99.56$0.47/M$0.49/M$0.005
16GPT-5 nanoOpenAI99.55$0.05/M$0.40/M$0.002
17Grok 3 Mini BetaSpaceXAI99.54$0.30/M$0.50/M$0.004
18Palmyra FinWriter99.54———
19GPT-5.1OpenAI99.51$1.3/M$10.0/M$0.057
20Gemini 2.5 ProGoogle99.5$1.3/M$10.0/M$0.057
21GPT Oss 120bOpenAI99.49$0.15/M$0.59/M$0.004
22DeepSeek-LLM-67B-Chat (V1)DeepSeek99.44———
23GPT-4.5 PreviewOpenAI99.41———
24Gemini 2.0 Flash (Reasoning)Google99.41———
25Gemini 2.0 Flash Lite (02-05 preview)Google99.35———
26OLMo 2 32B Instruct March 2025AllenAI99.34———
27GPT-4.1 miniOpenAI99.29$0.40/M$1.6/M$0.010
28GPT-4.1OpenAI99.25$2.0/M$8.0/M$0.050
29Kimi K2 InstructMoonshot99.25$0.57/M$2.3/M$0.014
30Palmyra X5Writer99.25$0.60/M$6.0/M$0.033
31Claude Sonnet 4+1 altAnthropic99.15$3.0/M$15.0/M$0.091
32GPT-4oOpenAI99.14$5.0/M$15.0/M$0.101
33Granite 3.3 8B InstructIBM99.13$0.03/M$0.25/M$0.001
34GPT-5 miniOpenAI99.11$0.25/M$2.0/M$0.011
35Qwen2 Instruct (72B)Alibaba99.1———
36GPT-5OpenAI99.1$1.3/M$10.0/M$0.057
37Qwen3 235B A22B FP8 ThroughputAlibaba99———
38GLM-4.5-AirZ.ai98.99$0.17/M$0.98/M$0.006
39Claude Opus 4+1 altAnthropic98.9$15.0/M$75.0/M$0.455
40Llama 3 Instruct 8BMeta98.83$0.04/M$0.14/M$0.001
41Gemini 2.5 FlashGoogle98.76$0.30/M$2.5/M$0.014
42Gemini 2.0 Pro Exp 02.05Google98.74———
43Gemini 2.5 Flash LiteGoogle98.71$0.10/M$0.40/M$0.003
44O3 MiniOpenAI98.64$1.1/M$4.4/M$0.028
45Palmyra-X-004Writer98.58———
46Qwen2.5 Instruct Turbo (7B)Alibaba98.5———
47GPT-4o miniOpenAI98.32$0.15/M$0.60/M$0.004
48O1OpenAI98.29$15.0/M$60.0/M$0.382
49O1 MiniOpenAI98.26———
50O3OpenAI98.25$2.0/M$8.0/M$0.051
51O4 MiniOpenAI98.24$1.1/M$4.4/M$0.028
52Claude Sonnet 4.5Anthropic98.21$3.0/M$15.0/M$0.092
53Llama 4 Maverick 17B 128E Instruct FP8Meta98.15$0.27/M$0.85/M$0.006
54Command R+ (Apr '24)Cohere98.03$2.5/M$10.0/M$0.064
55Palmyra MedWriter97.82———
56DeepSeek-R1+1 altDeepSeek97.24$2.0/M$4.0/M$0.031
57DeepSeek-V3DeepSeek97.14$0.24/M$0.90/M$0.006
58Gemini 3 ProGoogle97.05$2.0/M$12.0/M$0.072
59Claude Haiku 4.5Anthropic96.88$1.0/M$5.0/M$0.031
60Llama 3.1 8B InstructMeta96.84$0.02/M$0.04/M$0.000
61Llama 3 Instruct 70BMeta96.68$0.65/M$2.8/M$0.018
62Llama 4 ScoutMeta96.51$0.19/M$0.68/M$0.005
63Llama 3.1 Instruct 405BMeta96.46———
64Mistral Small 3 (Non-Reasoning)Mistral96.38$0.05/M$0.08/M$0.001
65Grok 4SpaceXAI95.65$3.0/M$15.0/M$0.094
66Grok 3 BetaSpaceXAI95.53$3.0/M$15.0/M$0.094
67Command RCohere93.73$0.15/M$0.60/M$0.004
68Llama 3.1 70B InstructMeta93.21$0.56/M$0.56/M$0.006
69OLMo 2 13B Instruct November 2024AllenAI90.66———
70Mistral Instruct V0.3 (7B)Mistral90.11———
71OLMoE 1B-7B Instruct January 2025AllenAI88.94———
72OLMo 2 7B Instruct November 2024AllenAI87.96———
73DBRX InstructDatabricks76.59———
74Mistral V0.1 (7B)Mistral71.05———
◆ solid = independently verified · aggregator attested · vendor attributed — outlined = cross-reference · source-attributed. Dimmed ◆ = confidence inferred. “+N alts” = alternate disclosures in the drawer with why-demoted. Prices per million tokens; $/point = input price ÷ score. Every row opens its model dossier.

Verification: 74 models scored · 74 independently verified · 0 with source disagreement. How these tiers are assigned