VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs GPT-5.5

AnthropicvsOpenAI43 shared benchmarks439 head-to-head
BenchmarkClaude Sonnet 4.5GPT-5.5
AA Agentic Index50.647.4
AA Intelligence37.456.3
AA-LCR68.379
AA-Omniscience-0.120.5
arc_agi_163.795
ARC-AGI-213.685
arena_elo14561482
arena_text_factuality14481482
Artificial Analysis Coding Index52.174.9
browsecomp24.184.4
coding_arena_elo13921457
critpt1.127.1
Fortress1716.3
frontiermath_tier_44.235.4
gdpval40.449.5
GPQA Diamond83.493.6
HealthBench44.256.5
HLE19.852.2
HLE (with tools)3252.2
hmmt_nov_202581.796.5
IFBench57.375.9
matharena_visual_math_overall75.894.9
MCP Atlas59.582.8
MMMU-Pro68.783.2
OmniScience Accuracy32.958
OmniScience Non-Hallucination50.912
OSWorld-Verified61.478.7
scicode4556.1
simplebench54.369
simpleqa_verified23.663.1
SWE-bench Pro43.658.6
SWE-bench Verified8280.6
TauBench V3 - Banking24.539
Terminal-Bench 2.05082.7
Terminal-Bench 2.155.884.3
Terminal-Bench Hard35.660.6
toolathlon4155.6
vectara_answer_rate95.6100
vectara_avg_summary_length127.8129.6
vectara_factual_consistency8890.7
vectara_hallucination_rate129.3
τ²-Bench Telecom (AA run)78.193.9
τ³-Bench1931.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.