VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

simpleqa_verified

70 models tracked

SimpleQA-Verified — Curated SimpleQA-Verified subset, Pass@1 metric; distinct from base SimpleQA and EM-metric variant.

#ModelVendorBest scoreRunsLast seen
1Gemini 3.1 ProGoogle77.362026-07-16
2Gemini 3 ProGoogle72.912026-05-20
3GPT-5.6 SolOpenAI71.622026-07-16
4Gemini 3.7 FlashGoogle71.212026-08-16
5Gemini 3.6 FlashGoogle68.712026-08-02
6Gemini 3.5 FlashGoogle68.412026-05-29
7Claude Fable 5Anthropic68.322026-07-16
8Qwen3 Max InstructAlibaba67.512026-05-20
9Gemini 3 Flash PreviewGoogle67.412026-05-20
10Muse SparkMeta66.312026-05-20
11GPT-5.5 ProOpenAI64.512026-05-20
12GPT-5.5OpenAI63.112026-05-20
13Qwen3.7 MaxAlibaba58.512026-06-14
14DeepSeek-V4-ProDeepSeek57.9132026-07-16
15Qwen3.6 Max PreviewAlibaba56.912026-05-20
16Opus 5Anthropic56.712026-07-25
17Gemini 2.5 ProGoogle5612026-05-20
18Grok 4.6SpaceXAI54.412026-08-14
19Grok4.5SpaceXAI53.512026-07-10
20o3OpenAI5312026-05-20
21Claude Opus 4.7Anthropic50.612026-05-20
22GPT-5OpenAI50.612026-05-20
23Qwen3 235B A22BAlibaba50.112026-05-20
24Qwen3.6 PlusAlibaba49.112026-05-20
25GPT-5.1OpenAI48.922026-06-20
26Grok 4SpaceXAI47.912026-05-20
27GPT-5.4 ProOpenAI47.812026-05-20
28Claude Opus 4.6Anthropic46.552026-06-27
29Qwen3.8 Max PreviewAlibaba46.312026-08-06
30GPT-5.4OpenAI45.352026-06-27
31DeepSeek-V4-FlashDeepSeek45102026-08-24
32InklingThinking Machines43.932026-08-14
33Inkling-SmallThinking Machines43.942026-08-24
34GPT-5.6 TerraOpenAI43.112026-07-10
35Kimi K3Moonshot42.712026-07-18
36Claude Opus 4.5Anthropic41.812026-05-30
37GPT-5.6 LunaOpenAI41.712026-07-10
38Claude Opus 4.8Anthropic39.512026-06-13
39Kimi K2.7 CodeMoonshot39.212026-06-14
40GPT-5.2OpenAI38.942026-05-20
41Kimi K2.6Moonshot38.762026-07-16
42GLM-5.2 Full Open SourceZ.ai38.132026-07-16
43GLM-5.1Z.ai38.142026-06-27
44GPT-5.5 InstantOpenAI3812026-08-14
45Grok 4.3 BetaSpaceXAI3812026-06-20
46Kimi K2.5Moonshot36.922026-07-16
47Grok 4.20SpaceXAI35.112026-07-14
48Claude Opus 4.1Anthropic34.812026-05-20
49GLM-4.7Z.ai31.512026-05-20
50MAI-Thinking-1Microsoft3112026-08-23
51Claude Sonnet 4.6Anthropic2912026-05-20
52GPT-5.4 miniOpenAI28.612026-05-20
53DeepSeek-V3.2DeepSeek27.512026-05-20
54DeepSeek-R1DeepSeek27.412026-05-20
55Qwen3.5 397B A17BAlibaba2622026-08-24
56Claude Sonnet 5Anthropic2512026-07-10
57o4-miniOpenAI23.912026-05-20
58Claude Sonnet 4.5Anthropic23.622026-05-30
59Qwen 3.6 FlashAlibaba21.212026-05-20
60Grok 3 Mini ReasoningSpaceXAI21.112026-05-20
61GPT-5 miniOpenAI2112026-05-20
62Qwen3.5 FlashAlibaba19.812026-08-07
63MiMo V2.5 ProXiaomi16.122026-08-24
64GPT OSS 120BOpenAI13.912026-05-20
65MiniMax M2.7MiniMax13.512026-08-24
66GPT-5 nanoOpenAI12.212026-05-20
67GPT-5.4 nanoOpenAI1212026-05-20
68Gemma 4 31BGoogle9.612026-05-20
69Claude 3.5 HaikuAnthropic6.722026-06-19
70Claude Haiku 4.5Anthropic5.912026-05-20

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.