VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

xstest

67 models tracked

XSTest — Standard exaggerated-safety-refusal benchmark; HELM + NVIDIA sources, wide but plausible score spread across 70 models

#ModelVendorBest scoreRunsLast seen
1Gemini 2.5 FlashGoogle98.812026-05-10
2Gemini 1.5 ProGoogle98.822026-08-23
3DeepSeek-R1DeepSeek98.822026-05-10
4Qwen3 235B A22B FP8 ThroughputAlibaba98.812026-05-10
5Gemini 2.5 ProGoogle98.712026-05-10
6GLM-4.5-AirZ.ai98.612026-05-10
7Grok 3 Mini BetaSpaceXAI98.412026-05-10
8Palmyra-X-004Writer98.412026-05-10
9Kimi K2 InstructMoonshot98.212026-05-10
10Qwen2.5 Instruct 72BAlibaba97.912026-05-10
11GPT-4.1OpenAI97.912026-05-10
12Gemini 2.5 Flash LiteGoogle97.812026-05-10
13GPT-4 TurboOpenAI97.712026-05-10
14GPT-4.1 miniOpenAI97.422026-06-19
15o4-miniOpenAI97.412026-05-10
16GPT-4oOpenAI97.312026-05-10
17o3OpenAI97.312026-05-10
18Claude Sonnet 4Anthropic97.232026-06-21
19DeepSeek-V3DeepSeek97.112026-05-10
20o1OpenAI9722026-06-18
21OpenAI o1-miniOpenAI9712026-05-10
22Claude 4 OpusAnthropic9722026-06-18
23Qwen2 Instruct (72B)Alibaba96.912026-05-10
24Llama 3 Instruct 70BMeta96.822026-06-19
25Grok 4SpaceXAI96.612026-05-10
26Qwen2.5 Instruct Turbo (7B)Alibaba96.612026-05-10
27Llama 4 Maverick 17B 128E Instruct FP8Meta96.512026-05-10
28Claude 3.7 SonnetAnthropic96.422026-06-21
29Grok 3 BetaSpaceXAI96.412026-05-10
30Palmyra MedWriter96.312026-05-10
31Palmyra FinWriter96.212026-05-10
32GPT-4o miniOpenAI9612026-05-10
33GPT-4.1 nanoOpenAI9622026-06-19
34Llama 3.1 Instruct 405BMeta95.912026-05-10
35Claude 3.5 SonnetAnthropic95.612026-05-10
36Llama 3 Instruct 8BMeta95.622026-06-19
37Llama 4 ScoutMeta95.612026-05-10
38Llama 4 Scout (17Bx16E) InstructMeta95.612026-06-26
39OLMo 2 32B Instruct March 2025AllenAI95.412026-05-10
40Gemini 2.0 Pro (02-05 preview)Google95.412026-05-10
41Palmyra X5Writer95.312026-05-10
42Llama 3.1 Instruct Turbo (8B)Meta95.312026-05-10
43Mistral Small 3 (Non-Reasoning)Mistral95.322026-06-19
44Gemini 2.0 Flash (Reasoning)Google95.312026-06-24
45GPT-4.5 PreviewOpenAI95.112026-05-10
46Shieldstral-1.0-3BMistral94.622026-08-23
47Llama 3.1 Instruct Turbo (70B)Meta94.512026-05-10
48o3-miniOpenAI94.112026-05-10
49Command RCohere93.912026-05-10
50Command R+ (Apr '24)Cohere93.812026-05-10
51Gemini 2.0 Flash Lite (02-05 preview)Google92.712026-06-24
52GPT OSS 120BOpenAI92.712026-05-10
53Gemini 2.0 Flash (Non-Reasoning)Google92.712026-05-10
54Gemini 1.5 Flash 8BGoogle92.612026-08-23
55OLMo 2 13B Instruct November 2024AllenAI92.612026-05-10
56Mistral Instruct V0.3 (7B)Mistral92.612026-05-10
57Claude 3 OpusAnthropic92.512026-05-10
58Gemini 1.5 Flash (001)Google92.112026-05-10
59Granite 3.3 8B InstructIBM90.712026-05-10
60DeepSeek-ChatDeepSeek88.912026-05-10
61OLMo 2 7B Instruct November 2024AllenAI88.812026-05-10
62Claude 3 SonnetAnthropic85.812026-05-10
63Claude 3 HaikuAnthropic85.312026-05-10
64OLMoE 1B-7B Instruct January 2025AllenAI84.312026-05-10
65PolyGuard-Qwen-7BAlibaba82.112026-08-04
66DBRX InstructDatabricks77.412026-05-10
67Mistral V0.1 (7B)Mistral68.712026-05-10

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.