Skip to content
VECTOR WIREAI INTELLIGENCE
UTC
Pro Mode — raw scores, one benchmark under the lensthird-party eval harness
The field · 76 measured
23.3100

76 models measured, most on the third-party eval harness. GPT Oss 120b tops the board at 100.

76 measured·Lifecycle Updated Oct 8, 2026Score basis
#◆Vendor$/M in$/M out
Leader — ignites whiteField — fill cools with scoreBars show 23.3–100 · ◆ solid = first-party or better · outlined = arm's-length
01GPT Oss 120bOpenAI100$0.15/M$0.59/M$0.004
02GPT Oss 20bOpenAI98.69$0.07/M$0.18/M$0.001
03GPT-5 nanoOpenAI98.44$0.05/M$0.40/M$0.002
04O3OpenAI98.38$2.0/M$8.0/M$0.051
05Claude 3.5 SonnetAnthropic98.06$3.0/M$15.0/M$0.092
06Claude Sonnet 4+1 altAnthropic98$3.0/M$15.0/M$0.092
07GPT-5OpenAI97.63$1.3/M$10.0/M$0.058
08GPT-5.1OpenAI97.56$1.3/M$10.0/M$0.058
09Claude 3 OpusAnthropic97.44$15.0/M$75.0/M$0.462
10Kimi K2 InstructMoonshot97.38$0.57/M$2.3/M$0.015
11GPT-5 miniOpenAI97.06$0.25/M$2.0/M$0.012
12O4 MiniOpenAI97$1.1/M$4.4/M$0.028
13O1OpenAI96.31$15.0/M$60.0/M$0.389
14Claude Haiku 4.5Anthropic95.88$1.0/M$5.0/M$0.031
15GPT-4.5 PreviewOpenAI95.81———
16Claude 3 SonnetAnthropic95.75———
17O3 MiniOpenAI95.19$1.1/M$4.4/M$0.029
18Claude Sonnet 4.5Anthropic92$3.0/M$15.0/M$0.098
19Claude Opus 4+1 altAnthropic91.69$15.0/M$75.0/M$0.491
20GPT-4.1OpenAI91.69$2.0/M$8.0/M$0.055
21Claude 3 HaikuAnthropic91.25$0.25/M$1.3/M$0.008
22GPT-4 TurboOpenAI89.81$10.0/M$30.0/M$0.223
23O1 MiniOpenAI88.5———
24Shieldstral-1.0-3BMistral87———
25GPT-4.1 nanoOpenAI86.75$0.10/M$0.40/M$0.003
26IBM Granite 4.0 SmallIBM86.38———
27Granite 4.0 MicroIBM86.25———
28GPT-4.1 miniOpenAI85.63$0.40/M$1.6/M$0.012
29Nemotron 3.5 Content Safety 4BNVIDIA85.3———
30GPT-4o miniOpenAI84.94$0.15/M$0.60/M$0.004
31Qwen3 Next 80B A3BAlibaba84.56$0.15/M$1.2/M$0.008
32Claude 3.7 SonnetAnthropic84.25$3.0/M$15.0/M$0.107
33Palmyra FinWriter84.06———
34OLMo 2 32B Instruct March 2025AllenAI84.06———
35GPT-4oOpenAI82.94$5.0/M$15.0/M$0.121
36Granite 3.3 8B InstructIBM81.19$0.03/M$0.25/M$0.002
37Gemini 1.5 Flash (001)Google80———
38Gemini 1.5 ProGoogle79.88———
39Qwen3 235B A22B Instruct 2507Alibaba79.63$0.23/M$0.92/M$0.007
40Qwen2 Instruct (72B)Alibaba76.75———
41Palmyra-X-004Writer73.81———
42Palmyra X5Writer73.81$0.60/M$6.0/M$0.045
43Qwen2.5 Instruct 72BAlibaba72.81$0.47/M$0.49/M$0.007
44Llama 3 Instruct 8BMeta72.69$0.04/M$0.14/M$0.001
45Gemini 3 ProGoogle72.5$2.0/M$12.0/M$0.097
46Gemini 2.0 Flash (Non-Reasoning)Google72.19———
47Gemini 2.0 Flash Lite (02-05 preview)Google72.19———
48Qwen2.5 Instruct Turbo (7B)Alibaba67.69———
49Gemini 2.5 Flash LiteGoogle67$0.10/M$0.40/M$0.004
50Llama 4 Maverick 17B 128E Instruct FP8Meta66.06$0.27/M$0.85/M$0.008
51Gemini 2.5 ProGoogle65.44$1.3/M$10.0/M$0.086
52Gemini 2.0 Pro Exp 02.05Google65.31———
53DeepSeek-LLM-67B-Chat (V1)DeepSeek64.94———
54Llama 3 Instruct 70BMeta64$0.65/M$2.8/M$0.027
55OLMoE 1B-7B Instruct January 2025AllenAI62.91———
56Llama 3.1 Instruct 405BMeta62.69———
57Gemini 2.5 FlashGoogle62.63$0.30/M$2.5/M$0.022
58Llama 3.1 8B InstructMeta61.63$0.02/M$0.04/M$0.000
59Llama 4 ScoutMeta60$0.19/M$0.68/M$0.007
60OLMo 2 7B Instruct November 2024AllenAI57.77———
61Grok 3 Mini BetaSpaceXAI57.19$0.30/M$0.50/M$0.007
62Qwen3 235B A22B FP8 ThroughputAlibaba56.94———
63GLM-4.5-AirZ.ai56.15$0.17/M$0.98/M$0.010
64Palmyra MedWriter55.63———
65OLMo 2 13B Instruct November 2024AllenAI51.88———
66Command RCohere50.44$0.15/M$0.60/M$0.007
67DeepSeek-V3DeepSeek49.69$0.24/M$0.90/M$0.011
68Command R+ (Apr '24)Cohere48.5$2.5/M$10.0/M$0.129
69DeepSeek-R1+1 altDeepSeek47.88$2.0/M$4.0/M$0.063
70Llama 3.1 70B InstructMeta46.88$0.56/M$0.56/M$0.012
71Grok 3 BetaSpaceXAI45.31$3.0/M$15.0/M$0.199
72Mistral Small 3 (Non-Reasoning)Mistral45.19$0.05/M$0.08/M$0.001
73Grok 4SpaceXAI39.69$3.0/M$15.0/M$0.227
74Mistral Instruct V0.3 (7B)Mistral34.38———
75DBRX InstructDatabricks27.1———
76Mistral V0.1 (7B)Mistral23.3———
◆ solid = independently verified · aggregator attested · vendor attributed — outlined = cross-reference · source-attributed. Dimmed ◆ = confidence inferred. “+N alts” = alternate disclosures in the drawer with why-demoted. Prices per million tokens; $/point = input price ÷ score. Every row opens its model dossier.

Verification: 76 models scored · 74 independently verified · 1 vendor cross-reference · 1 vendor-reported · 0 with source disagreement. How these tiers are assigned