VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs GPT-5.4

AnthropicvsOpenAI47 shared benchmarks344 head-to-head
BenchmarkClaude Sonnet 4.5GPT-5.4
AA Agentic Index50.658.2
AA Intelligence37.453.1
AA-LCR68.377.7
AA-Omniscience-0.15.8
arc_agi_163.793.7
ARC-AGI-213.674
arena_elo14561477
arena_text_factuality14481476
Artificial Analysis Coding Index52.171.1
browsecomp24.182.7
charxiv_rq67.282.8
coding_arena_elo13921457
critpt1.123.4
frontiermath_tier_44.227.1
gdpval40.450.1
GPQA Diamond83.493
HLE19.843.7
HLE (with tools)3252.1
hmmt_nov_202581.795.8
IFBench57.373.9
imo_answer_bench65.991.4
matharena_visual_math_overall75.892.5
MCP Atlas59.570.6
MMLU-Pro88.287.5
MMMU-Pro68.781.2
MultiNRC35.858.3
OmniDocBench 1.585.889.1
OmniScience Accuracy32.950.9
OmniScience Non-Hallucination50.917.4
OSWorld-Verified61.475
scicode4556.6
SEAL VISTA48.850.9
simpleqa_verified23.645.3
SWE-bench Multilingual6871.7
SWE-bench Pro43.659.1
TauBench V3 - Banking24.539.6
Terminal-Bench 2.05075.1
Terminal-Bench 2.155.878.3
Terminal-Bench Hard35.657.6
toolathlon4154.6
vectara_answer_rate95.699.9
vectara_avg_summary_length127.881.7
vectara_factual_consistency8893
vectara_hallucination_rate127
VisualToolBench6.229.2
τ²-Bench Telecom (AA run)78.187.1
τ³-Bench1972.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.