VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs Claude Sonnet 4.5

AnthropicvsAnthropic59 shared benchmarks947 head-to-head
BenchmarkClaude Sonnet 4Claude Sonnet 4.5
AA Agentic Index39.250.6
AA Intelligence29.837.4
AA-LCR69.768.3
AA-Omniscience0.2-0.1
AIME 20257488
AIR-Bench 202488.389.8
arc_agi_163.763.7
ARC-AGI-213.613.6
ArtifactsBench57.361.5
Artificial Analysis Coding Index37.652.1
browsecomp12.224.1
browsecomp_zh29.142.4
critpt1.11.1
FinSearchComp-global4260.8
Fortress24.417
frontiermath_tier_404.2
GAIA (text only)68.371.2
gdpval31.240.4
GPQA Diamond7883.4
HLE10.719.8
HLE (with tools)20.332
HMMT 202515.974.6
IFBench5557.3
LiveCodeBench68.571
LiveCodeBench v648.564
mmlu_redux93.695.6
MMLU-Pro8488.2
mmmlu86.589.1
MMMU74.479.6
MMMU-Pro62.468.7
Multi-SWE-Bench35.744.3
multichallenge57.155.3
MultiNRC18.435.8
OmniScience Accuracy22.732.9
OmniScience Non-Hallucination70.950.9
OSWorld-Verified42.261.4
scicode4045
SEAL VISTA45.548.8
simplebench45.554.3
swe_bench_bash64.971.4
SWE-bench Multilingual56.968
SWE-bench Pro42.743.6
SWE-bench Verified80.282
TAU-bench (airline)6070
TAU-bench (retail)80.586.2
TauBench V3 - Banking16.724.5
Terminal-Bench36.451
Terminal-Bench 2.136.355.8
Terminal-Bench Hard31.135.6
theagentcompany3741
vectara_answer_rate98.695.6
vectara_avg_summary_length145.8127.8
vectara_factual_consistency89.788
vectara_hallucination_rate10.312
VisualToolBench4.56.2
xbench_deepsearch64.666
τ²-Bench6598
τ²-Bench Telecom (AA run)64.678.1
τ³-Bench13.819

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.