VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

charxiv_rq

38 models tracked

CharXiv (Reasoning Questions) — CharXiv RQ subset; base (no python tool) variant

#ModelVendorBest scoreRunsLast seen
1Qwen3.8 27BAlibaba90.212026-08-24
2Gemini 3.1 ProGoogle89.942026-07-16
3Claude Fable 5Anthropic89.422026-08-24
4Claude Mythos 5Anthropic88.922026-06-12
5Gemini 3.7 FlashGoogle88.722026-08-24
6GPT-5.6 SolOpenAI87.822026-08-24
7Kimi K2.6Moonshot86.722026-07-16
8muse-glimmer-30bMeta85.912026-08-24
9GPT-5.6 TerraOpenAI85.912026-08-14
10Qwen3.7 Plus PreviewAlibaba85.912026-08-24
11Gemini 3.6 FlashGoogle85.212026-07-22
12Kimi K3Moonshot84.812026-08-24
13Gemini 3.5 FlashGoogle84.222026-08-24
14InklingThinking Machines83.422026-07-16
15GPT-5.4OpenAI82.812026-05-03
16GPT-5.6 LunaOpenAI82.712026-07-22
17Claude Opus 4.7Anthropic82.142026-07-06
18GPT-5.2OpenAI82.112026-06-15
19Grok4.5SpaceXAI81.612026-07-22
20Gemini 3 ProGoogle81.412026-06-15
21Inkling-SmallThinking Machines81.312026-08-21
22Qwen3.5 397B A17BAlibaba80.812026-08-24
23Claude Opus 4.8Anthropic80.542026-08-24
24Gemini 3 Flash PreviewGoogle80.312026-07-06
25Qwen3.5 27BAlibaba79.522026-08-24
26Kimi K2.5Moonshot78.732026-07-16
27Qwen3.6 27BAlibaba78.422026-08-24
28Qwen3.6 35B A3BAlibaba7812026-08-24
29Qwen3.5 35B A3BAlibaba77.512026-08-24
30Claude Sonnet 5Anthropic7712026-07-07
31Gemini 3.5 Flash LiteGoogle76.512026-08-24
32Claude Sonnet 4.6Anthropic72.422026-07-07
33Claude Opus 4.6Anthropic69.142026-08-24
34Gemma 4 26B A4BGoogle6912026-08-24
35Claude Opus 4.5Anthropic68.522026-08-24
36Gemma 4 31BGoogle67.922026-08-24
37Claude Sonnet 4.5Anthropic67.212026-08-24
38Qwen3 VL 235B A22B ReasoningAlibaba66.112026-06-15

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.