VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

anthropic_red_team

64 models tracked

HELM Safety (Anthropic Red Team subset) — HELM safety-suite component using Anthropic's published red-teaming prompt dataset

#ModelVendorBest scoreRunsLast seen
1Claude 3 HaikuAnthropic10012026-05-10
2Gemini 1.5 Flash (001)Google99.912026-05-10
3Gemini 1.5 ProGoogle99.912026-05-10
4Claude 3 SonnetAnthropic99.812026-05-10
5Claude 3 OpusAnthropic99.812026-05-10
6Claude 3.5 SonnetAnthropic99.812026-05-10
7GPT-4 TurboOpenAI99.712026-05-10
8Claude 3.7 SonnetAnthropic99.722026-06-21
9GPT-4.1 nanoOpenAI99.622026-06-19
10Qwen2.5 Instruct 72BAlibaba99.612026-05-10
11Palmyra FinWriter99.512026-05-10
12Grok 3 Mini BetaSpaceXAI99.512026-05-10
13Gemini 2.5 ProGoogle99.512026-05-10
14GPT OSS 120BOpenAI99.512026-05-10
15DeepSeek-ChatDeepSeek99.412026-05-10
16Gemini 2.0 Flash (Reasoning)Google99.412026-06-24
17GPT-4.5 PreviewOpenAI99.412026-05-10
18Gemini 2.0 Flash (Non-Reasoning)Google99.312026-05-10
19Gemini 2.0 Flash Lite (02-05 preview)Google99.312026-06-24
20OLMo 2 32B Instruct March 2025AllenAI99.312026-05-10
21GPT-4.1 miniOpenAI99.322026-06-19
22Palmyra X5Writer99.312026-05-10
23Kimi K2 InstructMoonshot99.312026-05-10
24GPT-4.1OpenAI99.312026-05-10
25Claude Sonnet 4Anthropic99.232026-06-21
26GPT-4oOpenAI99.112026-05-10
27Granite 3.3 8B InstructIBM99.112026-05-10
28Qwen2 Instruct (72B)Alibaba99.112026-05-10
29DeepSeek-R1DeepSeek99.122026-05-10
30Qwen3 235B A22B FP8 ThroughputAlibaba9912026-05-10
31GLM-4.5-AirZ.ai9912026-05-10
32Claude 4 OpusAnthropic98.922026-06-18
33Llama 3 Instruct 8BMeta98.822026-06-19
34Gemini 2.5 FlashGoogle98.812026-05-10
35Gemini 2.0 Pro (02-05 preview)Google98.712026-05-10
36Gemini 2.5 Flash LiteGoogle98.712026-05-10
37o3-miniOpenAI98.612026-05-10
38Palmyra-X-004Writer98.612026-05-10
39Qwen2.5 Instruct Turbo (7B)Alibaba98.512026-05-10
40GPT-4o miniOpenAI98.312026-05-10
41o1OpenAI98.322026-06-18
42OpenAI o1-miniOpenAI98.312026-05-10
43o3OpenAI98.312026-05-10
44o4-miniOpenAI98.212026-05-10
45Llama 4 Maverick 17B 128E Instruct FP8Meta98.212026-05-10
46Command R+ (Apr '24)Cohere9812026-05-10
47Palmyra MedWriter97.812026-05-10
48DeepSeek-V3DeepSeek97.112026-05-10
49Llama 3.1 Instruct Turbo (8B)Meta96.812026-05-10
50Llama 3 Instruct 70BMeta96.722026-06-19
51Llama 4 Scout (17Bx16E) InstructMeta96.512026-06-26
52Llama 4 ScoutMeta96.512026-05-10
53Llama 3.1 Instruct 405BMeta96.512026-05-10
54Mistral Small 3 (Non-Reasoning)Mistral96.422026-06-19
55Grok 4SpaceXAI95.712026-05-10
56Grok 3 BetaSpaceXAI95.512026-05-10
57Command RCohere93.712026-05-10
58Llama 3.1 Instruct Turbo (70B)Meta93.212026-05-10
59OLMo 2 13B Instruct November 2024AllenAI90.712026-05-10
60Mistral Instruct V0.3 (7B)Mistral90.112026-05-10
61OLMoE 1B-7B Instruct January 2025AllenAI88.912026-05-10
62OLMo 2 7B Instruct November 2024AllenAI8812026-05-10
63DBRX InstructDatabricks76.612026-05-10
64Mistral V0.1 (7B)Mistral7112026-05-10

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.