VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs GPT-4o

AnthropicvsOpenAI45 shared benchmarks396 head-to-head
BenchmarkClaude Sonnet 4.5GPT-4o
AA Agentic Index50.69.7
AA Intelligence37.411.2
AA-LCR68.355
AA-Omniscience-0.1-10.5
AI2D8794.2
AIME 20258811.7
AIR-Bench 202489.862.4
arc_agi_163.74.5
ARC-AGI-213.60
Artificial Analysis Coding Index52.124.2
critpt1.10
Fortress1747.2
gdpval40.40
GPQA Diamond83.470.1
HLE19.85.3
IFBench57.336
LiveCodeBench7138.3
LiveCodeBench v66430.9
longbench_v261.848.1
MathVista79.863.8
mmlu_redux95.688
MMLU-Pro88.274.7
mmmlu89.181.4
MMMU79.672.2
MMMU (val) (Pass@1)77.869.1
MMMU-Pro68.759.9
multichallenge55.340.3
MultiNRC35.812.4
OmniScience Accuracy32.923.7
OmniScience Non-Hallucination50.962.1
OSWorld-Verified61.45
RealWorldQA70.375.4
scicode4533.4
SEAL VISTA48.834.9
simplebench54.317.8
swe_bench_bash71.421.6
SWE-bench Verified8238.8
TAU-bench (airline)7042.8
TAU-bench (retail)86.260.3
Terminal-Bench Hard35.68.3
vectara_answer_rate95.693.8
vectara_avg_summary_length127.886.6
vectara_factual_consistency8890.4
vectara_hallucination_rate129.6
τ²-Bench Telecom (AA run)78.128.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.