Skip to content
VECTOR WIREAI INTELLIGENCE
UTC
Pro Mode — raw scores, one benchmark under the lensthird-party eval harness
The field · 74 measured
43.25100

74 models measured, most on the third-party eval harness. Claude 3 Sonnet tops the board at 100.

74 measured·Lifecycle Updated Oct 7, 2026Score basis
#◆Vendor$/M in$/M out
Leader — ignites whiteField — fill cools with scoreBars show 43.25–100 · ◆ solid = first-party or better · outlined = arm's-length
01Claude 3 SonnetAnthropic100———
02Kimi K2 InstructMoonshot100$0.57/M$2.3/M$0.014
03Granite 4.0 MicroIBM100———
04GPT-4.1 miniOpenAI100$0.40/M$1.6/M$0.010
05Command R+ (Apr '24)Cohere100$2.5/M$10.0/M$0.063
06Palmyra X5Writer100$0.60/M$6.0/M$0.033
07Claude Sonnet 4.5Anthropic100$3.0/M$15.0/M$0.090
08Claude 3.7 SonnetAnthropic100$3.0/M$15.0/M$0.090
09GPT Oss 120bOpenAI100$0.15/M$0.59/M$0.004
10GPT-5 nanoOpenAI100$0.05/M$0.40/M$0.002
11O4 MiniOpenAI100$1.1/M$4.4/M$0.028
12Claude 3 OpusAnthropic100$15.0/M$75.0/M$0.450
13Qwen3 235B A22B Instruct 2507Alibaba100$0.23/M$0.92/M$0.006
14Claude Opus 4+1 altAnthropic100$15.0/M$75.0/M$0.450
15Palmyra FinWriter100———
16Claude 3 HaikuAnthropic100$0.25/M$1.3/M$0.007
17GPT-4.5 PreviewOpenAI100———
18GPT-5 miniOpenAI100$0.25/M$2.0/M$0.011
19Claude Sonnet 4+1 altAnthropic100$3.0/M$15.0/M$0.090
20Palmyra-X-004Writer100———
21GPT-4.1OpenAI100$2.0/M$8.0/M$0.050
22GPT Oss 20bOpenAI100$0.07/M$0.18/M$0.001
23Qwen2.5 Instruct 72BAlibaba100$0.47/M$0.49/M$0.005
24IBM Granite 4.0 SmallIBM100———
25Claude 3.5 SonnetAnthropic100$3.0/M$15.0/M$0.090
26GPT-5.1OpenAI99.75$1.3/M$10.0/M$0.056
27GPT-5OpenAI99.75$1.3/M$10.0/M$0.056
28Qwen3 Next 80B A3BAlibaba99.5$0.15/M$1.2/M$0.007
29Llama 4 Maverick 17B 128E Instruct FP8Meta99.25$0.27/M$0.85/M$0.006
30Llama 3 Instruct 8BMeta99.25$0.04/M$0.14/M$0.001
31Grok 3 Mini BetaSpaceXAI99.25$0.30/M$0.50/M$0.004
32GPT-4.1 nanoOpenAI99$0.10/M$0.40/M$0.003
33O1OpenAI99$15.0/M$60.0/M$0.379
34GPT-4 TurboOpenAI99$10.0/M$30.0/M$0.202
35O3 MiniOpenAI99$1.1/M$4.4/M$0.028
36GLM-4.5-AirZ.ai99$0.17/M$0.98/M$0.006
37O3OpenAI99$2.0/M$8.0/M$0.051
38Llama 3 Instruct 70BMeta99$0.65/M$2.8/M$0.017
39Llama 3.1 8B InstructMeta98.75$0.02/M$0.04/M$0.000
40Claude Haiku 4.5Anthropic98.75$1.0/M$5.0/M$0.030
41Llama 3.1 Instruct 405BMeta98.75———
42Qwen2 Instruct (72B)Alibaba98.5———
43GPT-4oOpenAI98.5$5.0/M$15.0/M$0.102
44Palmyra MedWriter98.5———
45Qwen3 235B A22B FP8 ThroughputAlibaba98.5———
46Gemini 2.0 Flash (Reasoning)Google98.49———
47OLMo 2 32B Instruct March 2025AllenAI98———
48DeepSeek-R1+1 altDeepSeek98$2.0/M$4.0/M$0.031
49Gemini 2.5 FlashGoogle97.99$0.30/M$2.5/M$0.014
50GPT-4o miniOpenAI97.75$0.15/M$0.60/M$0.004
51Gemini 2.0 Flash Lite (02-05 preview)Google97.74———
52Granite 3.3 8B InstructIBM97.5$0.03/M$0.25/M$0.001
53Gemini 2.0 Pro Exp 02.05Google97.49———
54Gemini 3 ProGoogle97.49$2.0/M$12.0/M$0.072
55Gemini 1.5 ProGoogle97.49———
56O1 MiniOpenAI97———
57Llama 4 ScoutMeta97$0.19/M$0.68/M$0.004
58Gemini 1.5 Flash (001)Google96.98———
59Gemini 2.5 ProGoogle96.98$1.3/M$10.0/M$0.058
60Grok 3 BetaSpaceXAI96.75$3.0/M$15.0/M$0.093
61DeepSeek-LLM-67B-Chat (V1)DeepSeek96.75———
62Gemini 2.5 Flash LiteGoogle96.48$0.10/M$0.40/M$0.003
63Qwen2.5 Instruct Turbo (7B)Alibaba96———
64DeepSeek-V3DeepSeek95.25$0.24/M$0.90/M$0.006
65Command RCohere94.25$0.15/M$0.60/M$0.004
66Mistral Small 3 (Non-Reasoning)Mistral93.25$0.05/M$0.08/M$0.001
67Llama 3.1 70B InstructMeta92.5$0.56/M$0.56/M$0.006
68Grok 4SpaceXAI92.21$3.0/M$15.0/M$0.098
69OLMo 2 13B Instruct November 2024AllenAI81———
70Mistral Instruct V0.3 (7B)Mistral81———
71OLMo 2 7B Instruct November 2024AllenAI77.5———
72OLMoE 1B-7B Instruct January 2025AllenAI72.5———
73DBRX InstructDatabricks53.5———
74Mistral V0.1 (7B)Mistral43.25———
◆ solid = independently verified · aggregator attested · vendor attributed — outlined = cross-reference · source-attributed. Dimmed ◆ = confidence inferred. “+N alts” = alternate disclosures in the drawer with why-demoted. Prices per million tokens; $/point = input price ÷ score. Every row opens its model dossier.

Verification: 74 models scored · 74 independently verified · 0 with source disagreement. How these tiers are assigned