Skip to content
VECTOR WIREAI INTELLIGENCE
UTC
Pro Mode — raw scores, one benchmark under the lensthird-party eval harness
The field · 76 measured
68.6798.83

76 models measured, most on the third-party eval harness. Gemini 2.5 Flash tops the board at 98.83.

76 measured·Lifecycle Updated Oct 8, 2026Score basis
#◆Vendor$/M in$/M out
Leader — ignites whiteField — fill cools with scoreBars show 68.67–98.83 · ◆ solid = first-party or better · outlined = arm's-length
01Gemini 2.5 FlashGoogle98.83$0.30/M$2.5/M$0.014
02Gemini 1.5 Pro+1 altGoogle98.8VENDOR———
03Qwen3 235B A22B FP8 ThroughputAlibaba98.78———
04Gemini 2.5 ProGoogle98.67$1.3/M$10.0/M$0.057
05Qwen3 235B A22B Instruct 2507Alibaba98.56$0.23/M$0.92/M$0.006
06GLM-4.5-AirZ.ai98.56$0.17/M$0.98/M$0.006
07Grok 3 Mini BetaSpaceXAI98.44$0.30/M$0.50/M$0.004
08Palmyra-X-004Writer98.39———
09Qwen3 Next 80B A3BAlibaba98.28$0.15/M$1.2/M$0.007
10Kimi K2 InstructMoonshot98.22$0.57/M$2.3/M$0.015
11GPT-5.1OpenAI98.22$1.3/M$10.0/M$0.057
12Qwen2.5 Instruct 72BAlibaba97.94$0.47/M$0.49/M$0.005
13GPT-4.1OpenAI97.89$2.0/M$8.0/M$0.051
14Gemini 2.5 Flash LiteGoogle97.78$0.10/M$0.40/M$0.003
15GPT-4 TurboOpenAI97.72$10.0/M$30.0/M$0.205
16GPT-5 miniOpenAI97.67$0.25/M$2.0/M$0.012
17GPT-5 nanoOpenAI97.61$0.05/M$0.40/M$0.002
18GPT-4.1 miniOpenAI97.44$0.40/M$1.6/M$0.010
19O4 MiniOpenAI97.39$1.1/M$4.4/M$0.028
20Gemini 3 ProGoogle97.33$2.0/M$12.0/M$0.072
21O3OpenAI97.28$2.0/M$8.0/M$0.051
22GPT-4oOpenAI97.28$5.0/M$15.0/M$0.103
23DeepSeek-V3DeepSeek97.11$0.24/M$0.90/M$0.006
24GPT-5OpenAI97.06$1.3/M$10.0/M$0.058
25O1 MiniOpenAI97———
26Claude Opus 4+1 altAnthropic97$15.0/M$75.0/M$0.464
27O1OpenAI97$15.0/M$60.0/M$0.387
28Qwen2 Instruct (72B)Alibaba96.89———
29Llama 3 Instruct 70BMeta96.78$0.65/M$2.8/M$0.018
30Grok 4SpaceXAI96.61$3.0/M$15.0/M$0.093
31Claude Sonnet 4+1 altAnthropic96.61$3.0/M$15.0/M$0.093
32Qwen2.5 Instruct Turbo (7B)Alibaba96.56———
33Llama 4 Maverick 17B 128E Instruct FP8Meta96.5$0.27/M$0.85/M$0.006
34Grok 3 BetaSpaceXAI96.44$3.0/M$15.0/M$0.093
35Claude 3.7 SonnetAnthropic96.44$3.0/M$15.0/M$0.093
36Claude Sonnet 4.5Anthropic96.39$3.0/M$15.0/M$0.093
37Palmyra MedWriter96.33———
38Palmyra FinWriter96.17———
39GPT-4o miniOpenAI96$0.15/M$0.60/M$0.004
40GPT-4.1 nanoOpenAI96$0.10/M$0.40/M$0.003
41Llama 3.1 Instruct 405BMeta95.89———
42Llama 3 Instruct 8BMeta95.61$0.04/M$0.14/M$0.001
43Claude 3.5 SonnetAnthropic95.61$3.0/M$15.0/M$0.094
44Llama 4 ScoutMeta95.56$0.19/M$0.68/M$0.005
45OLMo 2 32B Instruct March 2025AllenAI95.44———
46Gemini 2.0 Pro Exp 02.05Google95.39———
47Palmyra X5Writer95.33$0.60/M$6.0/M$0.035
48Llama 3.1 8B InstructMeta95.33$0.02/M$0.04/M$0.000
49Mistral Small 3 (Non-Reasoning)Mistral95.28$0.05/M$0.08/M$0.001
50Gemini 2.0 Flash (Reasoning)Google95.28———
51GPT-4.5 PreviewOpenAI95.11———
52Shieldstral-1.0-3B+1 altMistral94.6VENDOR———
53Llama 3.1 70B InstructMeta94.5$0.56/M$0.56/M$0.006
54DeepSeek-R1+1 altDeepSeek94.44$2.0/M$4.0/M$0.032
55O3 MiniOpenAI94.06$1.1/M$4.4/M$0.029
56Command RCohere93.89$0.15/M$0.60/M$0.004
57Command R+ (Apr '24)Cohere93.83$2.5/M$10.0/M$0.067
58Claude Haiku 4.5Anthropic93.22$1.0/M$5.0/M$0.032
59GPT Oss 120bOpenAI92.67$0.15/M$0.59/M$0.004
60Gemini 2.0 Flash Lite (02-05 preview)Google92.67———
61Gemini 1.5 Flash 8BGoogle92.6VENDOR———
62OLMo 2 13B Instruct November 2024AllenAI92.56———
63Mistral Instruct V0.3 (7B)Mistral92.56———
64Claude 3 OpusAnthropic92.5$15.0/M$75.0/M$0.486
65Gemini 1.5 Flash (001)Google92.06———
66Granite 3.3 8B InstructIBM90.72$0.03/M$0.25/M$0.002
67DeepSeek-LLM-67B-Chat (V1)DeepSeek88.94———
68OLMo 2 7B Instruct November 2024AllenAI88.78———
69GPT Oss 20bOpenAI87.17$0.07/M$0.18/M$0.001
70Claude 3 SonnetAnthropic85.83———
71Claude 3 HaikuAnthropic85.28$0.25/M$1.3/M$0.009
72OLMoE 1B-7B Instruct January 2025AllenAI84.28———
73IBM Granite 4.0 SmallIBM80.56———
74DBRX InstructDatabricks77.44———
75Granite 4.0 MicroIBM75.44———
76Mistral V0.1 (7B)Mistral68.67———
◆ solid = independently verified · aggregator attested · vendor attributed — outlined = cross-reference · source-attributed. Dimmed ◆ = confidence inferred. “+N alts” = alternate disclosures in the drawer with why-demoted. Prices per million tokens; $/point = input price ÷ score. Every row opens its model dossier.

Verification: 76 models scored · 73 independently verified · 3 vendor-reported · 0 with source disagreement. How these tiers are assigned