VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

simple_safety_tests

64 models tracked

Simple Safety Tests (HELM) — HELM-hosted safety benchmark; unrelated to 'simplebench'/'simpleqa' families despite similar naming.

#ModelVendorBest scoreRunsLast seen
1Claude 3.5 SonnetAnthropic10012026-05-10
2Palmyra FinWriter10012026-05-10
3Qwen2.5 Instruct 72BAlibaba10012026-05-10
4Claude 3 HaikuAnthropic10012026-05-10
5Claude Sonnet 4Anthropic10032026-06-21
6GPT-4.5 PreviewOpenAI10012026-05-10
7GPT-4.1 miniOpenAI10022026-06-19
8Command R+ (Apr '24)Cohere10012026-05-10
9Palmyra X5Writer10012026-05-10
10Claude 3 OpusAnthropic10012026-05-10
11GPT-4.1OpenAI10012026-05-10
12Claude 4 OpusAnthropic10022026-06-18
13Kimi K2 InstructMoonshot10012026-05-10
14Claude 3 SonnetAnthropic10012026-05-10
15Claude 3.7 SonnetAnthropic10022026-06-21
16GPT OSS 120BOpenAI10012026-05-10
17o4-miniOpenAI10012026-05-10
18Palmyra-X-004Writer10012026-05-10
19Llama 4 Maverick 17B 128E Instruct FP8Meta99.312026-05-10
20Llama 3 Instruct 8BMeta99.322026-06-19
21Grok 3 Mini BetaSpaceXAI99.312026-05-10
22o1OpenAI9922026-06-18
23o3-miniOpenAI9912026-05-10
24GPT-4 TurboOpenAI9912026-05-10
25GLM-4.5-AirZ.ai9912026-05-10
26o3OpenAI9912026-05-10
27Llama 3 Instruct 70BMeta9922026-06-19
28GPT-4.1 nanoOpenAI9922026-06-19
29Llama 3.1 Instruct Turbo (8B)Meta98.812026-05-10
30Llama 3.1 Instruct 405BMeta98.812026-05-10
31GPT-4oOpenAI98.512026-05-10
32Qwen3 235B A22B FP8 ThroughputAlibaba98.512026-05-10
33Qwen2 Instruct (72B)Alibaba98.512026-05-10
34Palmyra MedWriter98.512026-05-10
35Gemini 2.0 Flash (Reasoning)Google98.512026-06-24
36DeepSeek-R1DeepSeek98.322026-05-10
37OLMo 2 32B Instruct March 2025AllenAI9812026-05-10
38Gemini 2.5 FlashGoogle9812026-05-10
39GPT-4o miniOpenAI97.812026-05-10
40Gemini 2.0 Flash (Non-Reasoning)Google97.712026-05-10
41Gemini 2.0 Flash Lite (02-05 preview)Google97.712026-06-24
42Granite 3.3 8B InstructIBM97.512026-05-10
43Gemini 2.0 Pro (02-05 preview)Google97.512026-05-10
44Gemini 1.5 ProGoogle97.512026-05-10
45OpenAI o1-miniOpenAI9712026-05-10
46Llama 4 Scout (17Bx16E) InstructMeta9712026-06-26
47Llama 4 ScoutMeta9712026-05-10
48Gemini 2.5 ProGoogle9712026-05-10
49Gemini 1.5 Flash (001)Google9712026-05-10
50DeepSeek-ChatDeepSeek96.812026-05-10
51Grok 3 BetaSpaceXAI96.812026-05-10
52Gemini 2.5 Flash LiteGoogle96.512026-05-10
53Qwen2.5 Instruct Turbo (7B)Alibaba9612026-05-10
54DeepSeek-V3DeepSeek95.312026-05-10
55Command RCohere94.312026-05-10
56Mistral Small 3 (Non-Reasoning)Mistral93.322026-06-19
57Llama 3.1 Instruct Turbo (70B)Meta92.512026-05-10
58Grok 4SpaceXAI92.212026-05-10
59OLMo 2 13B Instruct November 2024AllenAI8112026-05-10
60Mistral Instruct V0.3 (7B)Mistral8112026-05-10
61OLMo 2 7B Instruct November 2024AllenAI77.512026-05-10
62OLMoE 1B-7B Instruct January 2025AllenAI72.512026-05-10
63DBRX InstructDatabricks53.512026-05-10
64Mistral V0.1 (7B)Mistral43.312026-05-10

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.