VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs GPT-5

AnthropicvsOpenAI83 shared benchmarks2954 head-to-head
BenchmarkClaude Sonnet 4.5GPT-5
AA Agentic Index50.649.7
AA Intelligence37.435.3
AA-LCR68.376.3
AA-Omniscience-0.1-8.7
AIME 20258895
AIME25 no tools8894.6
AIME25 w/ python10099.6
AIR-Bench 202489.887.7
arc_agi_163.756.2
ARC-AGI-213.67.5
Arena-Hard (Creative Writing)76.792.2
Arena-Hard (Hard Prompt)63.371.9
ArtifactsBench61.573
Artificial Analysis Coding Index52.138.9
browsecomp24.154.9
BrowseComp w/ tools24.154.9
browsecomp_zh42.465
BrowseComp-ZH w/ tools42.463
coding_arena_elo13921419
critpt1.15.7
FinSearchComp-global60.863.9
FinSearchComp-T34448.5
FinSearchComp-T3 w/ tools4448.5
Fortress1717
Frames8586
Frames w/ tools8586
frontiermath_tier_44.212.5
GAIA (text only)71.276.4
gdpval40.432.5
GPQA (unspecified)83.485.7
GPQA Diamond83.487.3
HealthBench44.267.2
HealthBench no tools44.267.2
HLE19.828.5
HLE (with tools)3235.2
HMMT 202574.693.3
hmmt_feb_202579.288.3
hmmt_nov_202581.789.2
HMMT25 no tools74.693.3
HMMT25 w/ python88.896.7
IFBench57.373.1
imo_answer_bench65.976
LiveCodeBench7185
LiveCodeBench v66487
LiveCodeBenchV6 no tools6487
Longform Writing eval (Kimi K2 Thinking system card)79.871.4
matharena_visual_math_overall75.878.8
mmlu_redux95.695.3
MMLU-Pro88.287.5
MMMU79.684.2
MMMU-Pro68.778.4
Multi-SWE-Bench44.339.3
multichallenge55.371.1
MultiNRC35.852.1
OJ-Bench (cpp)30.456.2
OJ-Bench (cpp) no tools30.456.2
OmniScience Accuracy32.940.3
OmniScience Non-Hallucination50.921
scicode4543
SEAL VISTA48.849.7
Seal-053.451.4
Seal-0 w/ tools53.451.4
simplebench54.356.7
simpleqa_verified23.650.6
swe_bench_bash71.465
SWE-bench Multilingual6855.3
SWE-bench Pro43.641.8
SWE-bench Verified8274.9
TauBench V3 - Banking24.522.1
Terminal-Bench5143.8
Terminal-Bench 2.05035.2
Terminal-Bench 2.155.835.2
Terminal-Bench Hard35.637.9
Terminal-Bench w/ simulated tools (JSON)5143.8
vectara_answer_rate95.699.9
vectara_avg_summary_length127.8162.7
vectara_factual_consistency8885.3
vectara_hallucination_rate1214.7
VisualToolBench6.218.7
xbench_deepsearch6677.8
τ²-Bench9885
τ²-Bench Telecom (AA run)78.186.5
τ³-Bench1919.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.