VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

AIR-Bench 2024

70 models tracked

AIR-Bench 2024 — HELM's AI Risk benchmark; single-vendor 'AIR-Bench' value 75.6 fits its 25-90 range

#ModelVendorBest scoreRunsLast seen
1Claude Sonnet 4.5Anthropic89.812026-05-19
2Claude Sonnet 4Anthropic88.312026-05-19
3GPT OSS 120BOpenAI8812026-05-19
4MAI-Thinking-1Microsoft8812026-08-23
5GPT-5 nanoOpenAI87.822026-06-18
6GPT-5OpenAI87.742026-08-10
7Qwen3 Next 80B A3BAlibaba86.712026-05-19
8gpt-oss-20bOpenAI8612026-05-19
9Claude 3.5 SonnetAnthropic85.912026-05-19
10Claude 4 OpusAnthropic85.712026-05-19
11GPT-5 miniOpenAI85.712026-05-19
12Claude 3 SonnetAnthropic84.712026-05-19
13o3OpenAI84.512026-05-19
14Claude 3 OpusAnthropic84.412026-05-19
15Gemini 1.5 ProGoogle82.822026-05-19
16Claude 3 HaikuAnthropic82.712026-05-19
17Granite 3.3 8B InstructIBM82.512026-05-19
18Claude 3.7 SonnetAnthropic81.822026-06-21
19o1OpenAI8022026-06-18
20Gemini 1.5 Flash (001)Google79.422026-05-19
21Qwen3 235B A22B Instruct 2507Alibaba7922026-06-19
22o4-miniOpenAI78.512026-05-19
23Palmyra X5Writer78.212026-05-19
24Seed Oss 36B InstructByteDance75.612026-06-15
25o3-miniOpenAI74.912026-05-19
26GPT-4.5 PreviewOpenAI74.212026-05-19
27Kimi K2 InstructMoonshot74.112026-05-19
28Gemini 2.5 ProGoogle73.612026-05-19
29GPT-4 TurboOpenAI71.912026-05-19
30Llama 3 Instruct 8BMeta70.922026-06-19
31Gemini 2.5 FlashGoogle68.712026-05-19
32Llama 4 Maverick 17B 128E Instruct FP8Meta68.612026-05-19
33Gemini 2.0 Pro (02-05 preview)Google68.412026-05-19
34Gemini 2.0 Flash (Non-Reasoning)Google67.512026-05-19
35Gemini 2.0 Flash Lite (02-05 preview)Google67.512026-06-24
36Palmyra FinWriter66.312026-05-19
37Gemini 2.0 Flash (Reasoning)Google66.212026-06-24
38Gemini 2.5 Flash LiteGoogle65.812026-05-19
39GPT-4.1OpenAI64.812026-05-19
40Llama 3 Instruct 70BMeta64.622026-06-19
41GPT4OpenAI64.212026-05-19
42GPT-4oOpenAI62.422026-05-19
43Llama 3.1 Instruct Turbo (8B)Meta62.312026-05-19
44Qwen2 Instruct (72B)Alibaba62.112026-05-19
45GPT-4.1 nanoOpenAI61.522026-06-19
46GPT-4.1 miniOpenAI60.422026-06-19
47Qwen2.5 Instruct 72BAlibaba5912026-05-19
48Llama 3.1 Instruct 405BMeta58.612026-05-19
49Palmyra MedWriter57.812026-05-19
50GLM-4.5-AirZ.ai57.112026-05-19
51GPT-4o miniOpenAI56.312026-05-19
52Qwen3 235B A22B FP8 ThroughputAlibaba5612026-05-19
53Grok 3 Mini BetaSpaceXAI53.512026-05-19
54DeepSeek-R1DeepSeek52.912026-05-19
55Llama 4 Scout (17Bx16E) InstructMeta52.312026-06-26
56Llama 4 ScoutMeta52.312026-05-19
57Grok 3 BetaSpaceXAI51.312026-05-19
58DeepSeek-ChatDeepSeek50.512026-05-19
59Qwen2.5 Instruct Turbo (7B)Alibaba4712026-05-19
60OpenAI o1-miniOpenAI45.312026-05-19
61Grok 4SpaceXAI44.412026-05-19
62Palmyra-X-004Writer44.212026-05-19
63Llama 3.1 Instruct Turbo (70B)Meta42.512026-05-19
64DeepSeek-V3DeepSeek40.812026-05-19
65Mistral Large 2Mistral35.312026-05-19
66Mistral Small 3 (Non-Reasoning)Mistral32.822026-06-19
67Mistral Instruct V0.3 (7B)Mistral32.512026-05-19
68Command RCohere31.812026-05-19
69Command R+ (Apr '24)Cohere29.312026-05-19
70DBRX InstructDatabricks25.412026-05-19

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.