VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.5 vs Claude Sonnet 4.5

AnthropicvsAnthropic81 shared benchmarks727 head-to-head
BenchmarkClaude Opus 4.5Claude Sonnet 4.5
AA Agentic Index59.650.6
AA Intelligence41.937.4
AA-LCR7668.3
AA-Omniscience14-0.1
AIME 202592.888
AIME25 no tools9188
arc_agi_18263.7
ARC-AGI-237.613.6
ARC-AGI-2 (Verified)37.613.6
arena_elo14731456
arena_text_factuality14581448
Artificial Analysis Coding Index47.852.1
browsecomp3724.1
BrowseComp (context management)59.226.1
browsecomp_zh62.442.4
BrowseComp-Plus (with tool result clearing + memory)72.967.2
BrowseComp-Plus (with tool result clearing)67.660.4
CC-OCR76.968.1
charxiv_rq68.567.2
coding_arena_elo14951392
critpt4.61.1
Fortress13.617
frontiermath_tier_44.24.2
gdpval47.340.4
GPQA Diamond8783.4
HLE30.819.8
HLE (with tools)43.432
hmmt_feb_202592.979.2
hmmt_nov_202593.381.7
IFBench5857.3
imo_answer_bench8465.9
LAB-Bench FigQA (no tools)54.952.3
LAB-Bench FigQA (with tools)69.263.7
LiveCodeBench8771
LiveCodeBench v684.864
longbench_v264.461.8
MathVista80.279.8
MCP Atlas69.859.5
mmlu_redux95.695.6
MMLU-Pro9088.2
mmmlu90.889.1
MMMU80.779.6
MMMU-Pro7468.7
Multi-SWE-Bench5044.3
multichallenge5955.3
MultiNRC48.635.8
OctoCodingbench36.222.8
OJ-Bench (cpp)54.630.4
OmniDocBench 1.587.785.8
OmniScience Accuracy46.632.9
OmniScience Non-Hallucination3950.9
OSWorld-Verified66.361.4
RealWorldQA7770.3
scicode5045
SEAL VISTA46.448.8
Seal-047.753.4
simplebench6254.3
simpleqa_verified41.823.6
SimpleVQA69.757.6
swe_bench_bash76.871.4
SWE-bench Multilingual77.568
SWE-bench Pro57.143.6
SWE-bench Verified81.582
SWE-Perf4.73
SWT-bench80.269.5
Terminal-Bench 2.059.350
Terminal-Bench Hard4735.6
toolathlon43.541
vectara_answer_rate98.795.6
vectara_avg_summary_length114.5127.8
vectara_factual_consistency89.188
vectara_hallucination_rate10.912
VIBE (Average)90.785.2
VIBE-Android92.287.5
VIBE-Backend9890.8
VIBE-iOS9081.2
VIBE-Simulation8479.1
VIBE-Web89.187.3
τ²-Bench98.298
τ²-Bench (Retail)88.986.2
τ²-Bench Telecom (AA run)89.578.1

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.