VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs GPT-5.1

AnthropicvsOpenAI44 shared benchmarks836 head-to-head
BenchmarkClaude Sonnet 4GPT-5.1
AA Agentic Index39.232.2
AA Intelligence29.837.5
AA-LCR69.776.7
AA-Omniscience0.25.4
AIME 20257494.2
arc_agi_163.772.8
ARC-AGI-213.617.6
arena_vision12071250
Artificial Analysis Coding Index37.649.4
browsecomp12.250.8
critpt1.14.9
Fortress24.425.7
frontiermath_tier_4012.5
gdpval31.225
GPQA Diamond7888.1
HLE10.728.5
HLE (with tools)20.342.7
IFBench5572.9
LiveCodeBench v648.587
MMLU-Pro8487
mmmlu86.591
MMMU74.485.4
MMMU-Pro62.475.5
multichallenge57.163.4
MultiNRC18.449
OmniScience Accuracy22.737.7
OmniScience Non-Hallucination70.948.1
scicode4043.3
SEAL VISTA45.543.8
simplebench45.553.2
swe_bench_bash64.966
SWE-bench Verified80.276.3
Tau2 airline55.567
Tau2 retail7577.9
TauBench V3 - Banking16.715.9
Terminal-Bench 2.136.352.4
Terminal-Bench Hard31.145.5
vectara_answer_rate98.6100
vectara_avg_summary_length145.8254.4
vectara_factual_consistency89.789.1
vectara_hallucination_rate10.312.1
τ²-Bench6582.7
τ²-Bench Telecom (AA run)64.681.9
τ³-Bench13.814

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.