VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

bbq

64 models tracked

BBQ (Bias Benchmark for QA) — HELM safety-suite component; Ambig/Disambig Accuracy/Bias sub-metrics kept separate (metric axis)

#ModelVendorBest scoreRunsLast seen
1Claude 4 OpusAnthropic99.322026-06-18
2GPT OSS 120BOpenAI98.512026-05-10
3o3OpenAI97.912026-05-10
4Claude Sonnet 4Anthropic97.932026-06-21
5GLM-4.5-AirZ.ai97.812026-05-10
6Gemini 2.5 FlashGoogle97.712026-05-10
7o1OpenAI97.322026-06-18
8OpenAI o1-miniOpenAI96.912026-05-10
9Grok 3 Mini BetaSpaceXAI96.712026-05-10
10DeepSeek-V3DeepSeek96.712026-05-10
11DeepSeek-R1DeepSeek96.622026-05-10
12Qwen3 235B A22B FP8 ThroughputAlibaba96.612026-05-10
13Gemini 2.5 ProGoogle96.412026-05-10
14Gemini 2.0 Pro (02-05 preview)Google95.612026-05-10
15Palmyra-X-004Writer95.512026-05-10
16Qwen2.5 Instruct 72BAlibaba95.412026-05-10
17Gemini 2.0 Flash (Reasoning)Google95.412026-06-24
18Llama 3.1 Instruct Turbo (70B)Meta95.412026-05-10
19Qwen2 Instruct (72B)Alibaba95.112026-05-10
20GPT-4oOpenAI95.112026-05-10
21Gemini 2.5 Flash LiteGoogle94.912026-05-10
22Claude 3.5 SonnetAnthropic94.912026-05-10
23Kimi K2 InstructMoonshot94.912026-05-10
24Palmyra X5Writer94.812026-05-10
25Gemini 1.5 Flash (001)Google94.712026-05-10
26Gemini 1.5 ProGoogle94.512026-05-10
27Llama 3.1 Instruct 405BMeta94.512026-05-10
28Palmyra FinWriter94.212026-05-10
29GPT-4 TurboOpenAI94.112026-05-10
30o3-miniOpenAI94.112026-05-10
31Claude 3 OpusAnthropic9412026-05-10
32o4-miniOpenAI9412026-05-10
33Grok 4SpaceXAI93.712026-05-10
34Grok 3 BetaSpaceXAI93.612026-05-10
35Mistral Small 3 (Non-Reasoning)Mistral93.322026-06-19
36Llama 4 Maverick 17B 128E Instruct FP8Meta9312026-05-10
37GPT-4.1OpenAI92.612026-05-10
38GPT-4.1 miniOpenAI92.122026-06-19
39Claude 3.7 SonnetAnthropic92.122026-06-21
40GPT-4.5 PreviewOpenAI9212026-05-10
41Gemini 2.0 Flash Lite (02-05 preview)Google9212026-06-24
42Gemini 2.0 Flash (Non-Reasoning)Google9212026-05-10
43Llama 3 Instruct 70BMeta9122026-06-19
44Qwen2.5 Instruct Turbo (7B)Alibaba90.612026-05-10
45Claude 3 SonnetAnthropic9012026-05-10
46Command R+ (Apr '24)Cohere89.912026-05-10
47GPT-4o miniOpenAI88.212026-05-10
48Llama 4 Scout (17Bx16E) InstructMeta87.512026-06-26
49GPT-4.1 nanoOpenAI87.522026-06-19
50Llama 4 ScoutMeta87.512026-05-10
51DeepSeek-ChatDeepSeek86.212026-05-10
52Granite 3.3 8B InstructIBM8412026-05-10
53Palmyra MedWriter80.112026-05-10
54DBRX InstructDatabricks79.212026-05-10
55Llama 3.1 Instruct Turbo (8B)Meta78.512026-05-10
56Llama 3 Instruct 8BMeta76.522026-06-19
57Command RCohere72.412026-05-10
58OLMo 2 32B Instruct March 2025AllenAI71.412026-05-10
59OLMo 2 13B Instruct November 2024AllenAI70.412026-05-10
60Mistral Instruct V0.3 (7B)Mistral66.812026-05-10
61Claude 3 HaikuAnthropic62.512026-05-10
62Mistral V0.1 (7B)Mistral56.512026-05-10
63OLMo 2 7B Instruct November 2024AllenAI52.512026-05-10
64OLMoE 1B-7B Instruct January 2025AllenAI41.912026-05-10

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.