VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

simplebench

86 models tracked

SimpleBench — General-reasoning/trick-question benchmark; unrelated to SimpleQA family despite similar name.

#ModelVendorBest scoreRunsLast seen
1Claude Fable 5Anthropic81.912026-06-11
2Opus 5Anthropic80.612026-07-25
3Gemini 3.1 ProGoogle79.612026-05-10
4GPT-5.5 ProOpenAI76.912026-05-10
5Gemini 3.5 FlashGoogle76.712026-05-21
6Gemini 3 ProGoogle76.432026-05-19
7Grok 4.6SpaceXAI75.912026-08-14
8Muse Spark 1.2Meta74.512026-08-14
9GPT-5.6 Sol ProOpenAI71.712026-07-10
10Qwen3.7 MaxAlibaba70.412026-05-22
11Grok4.5SpaceXAI7012026-07-09
12GPT-5.5OpenAI6912026-05-10
13Claude Opus 4.6Anthropic67.612026-05-10
14GLM-5.3Z.ai66.212026-08-21
15Claude Opus 4.8Anthropic64.812026-05-29
16GPT-5.6 SolOpenAI64.812026-07-10
17Qwen3.6 Max PreviewAlibaba6312026-05-21
18Qwen3.8 2.4T A95BAlibaba62.512026-08-14
19Gemini 2.5 ProGoogle62.422026-05-10
20Gemini 2.5 Pro Preview 06.05 (32k think)Google62.412026-05-30
21Claude Opus 4.5Anthropic6212026-05-10
22Claude Opus 4.7Anthropic61.712026-05-10
23GPT-5 ProOpenAI61.612026-05-10
24Gemini 3 Flash PreviewGoogle61.112026-05-15
25Kimi K3Moonshot60.712026-07-18
26Claude Sonnet 5Anthropic60.612026-07-10
27Grok 4SpaceXAI60.512026-05-10
28Qwen3.8 27BAlibaba60.212026-08-21
29Claude Opus 4.1Anthropic6022026-05-30
30GLM-5.2 Full Open SourceZ.ai58.822026-07-13
31Claude 4 OpusAnthropic58.812026-05-10
32Kimi K2.7 CodeMoonshot57.912026-07-10
33GPT-5.2 ProOpenAI57.412026-05-10
34GPT-5OpenAI56.722026-05-19
35Grok 4.1 FastSpaceXAI5612026-05-10
36GLM-5.1Z.ai55.112026-07-10
37Claude Sonnet 4.5Anthropic54.362026-08-10
38GPT-5.1OpenAI53.222026-06-20
39GLM-5Z.ai53.212026-05-10
40o3OpenAI53.112026-05-10
41DeepSeek-V3.2-SpecialeDeepSeek52.612026-05-10
42DeepSeek-V4-ProDeepSeek50.922026-06-28
43InklingThinking Machines5012026-07-23
44GPT-5.6 TerraOpenAI48.912026-07-10
45GLM-4.7Z.ai47.712026-05-10
46Kimi K2.5Moonshot46.812026-05-10
47GPT-5.6 LunaOpenAI46.812026-07-10
48Claude 3.7 SonnetAnthropic46.422026-05-10
49DeepSeek-V4-FlashDeepSeek46.312026-06-03
50GPT-5.2OpenAI45.822026-05-19
51MiniMax M3MiniMax45.812026-07-10
52Claude Sonnet 4Anthropic45.522026-06-20
53Nemotron 3 Ultra 550B A55BNVIDIA41.712026-06-08
54o1OpenAI41.722026-05-10
55Claude 3.5 SonnetAnthropic41.422026-05-10
56Gemini 2.5 FlashGoogle41.212026-05-10
57DeepSeek-R1DeepSeek40.822026-05-10
58DeepSeek-V3.1DeepSeek4022026-05-15
59Kimi K2 (Reasoning)Moonshot39.622026-05-10
60o4-miniOpenAI38.712026-05-10
61Grok 3SpaceXAI36.122026-06-19
62Qwen 3.6 FlashAlibaba35.212026-07-10
63MiniMax M2.1MiniMax34.712026-05-10
64GPT-4.5 PreviewOpenAI34.512026-05-10
65Gemini Exp 1206Google31.112026-05-10
66Qwen3 235B A22BAlibaba3112026-05-10
67Gemini 2.0 Flash (Reasoning)Google30.712026-05-10
68Llama 4 MaverickMeta27.712026-05-10
69DeepSeek-V3DeepSeek27.222026-05-10
70Gemini 1.5 ProGoogle27.112026-05-10
71GPT-4.1OpenAI2712026-05-10
72GPT-4 TurboOpenAI25.112026-05-10
73MiniMax M2MiniMax2512026-05-10
74Claude 3 OpusAnthropic23.512026-05-10
75Llama 3.1 Instruct 405BMeta2312026-05-10
76o3-miniOpenAI22.812026-05-10
77Grok 2SpaceXAI22.712026-05-10
78Mistral Large 2Mistral22.512026-05-10
79GPT OSS 120BOpenAI22.112026-05-10
80Mistral Large 3Mistral20.422026-06-19
81Llama 3.3 70B InstructMeta19.912026-05-10
82Gemini 2.0 Flash ExpGoogle18.912026-05-15
83OpenAI o1-miniOpenAI18.112026-05-10
84GPT-4oOpenAI17.812026-05-10
85Command R+ (Apr '24)Cohere17.412026-05-10
86GPT-4o miniOpenAI10.712026-05-10

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.