VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.6 vs Claude Sonnet 4.5

AnthropicvsAnthropic60 shared benchmarks528 head-to-head
BenchmarkClaude Opus 4.6Claude Sonnet 4.5
AA Agentic Index67.650.6
AA Intelligence44.937.4
AA-LCR74.368.3
AA-Omniscience13.7-0.1
AIME 202599.888
AIME25 no tools95.688
arc_agi_19363.7
ARC-AGI-268.813.6
arena_elo14971456
arena_text_factuality14871448
Artificial Analysis Coding Index48.152.1
browsecomp86.824.1
charxiv_rq69.167.2
coding_arena_elo15451392
critpt12.61.1
Fortress20.517
frontiermath_tier_422.94.2
gdpval55.940.4
GPQA Diamond91.383.4
HLE53.119.8
HLE (with tools)62.732
hmmt_nov_202596.381.7
IFBench62.557.3
imo_answer_bench75.365.9
LiveCodeBench88.871
LiveCodeBench v688.864
matharena_visual_math_overall72.375.8
MCP Atlas76.859.5
MHGRN (8-needle 1M variant)7618.5
MMLU-Pro89.188.2
mmmlu91.189.1
MMMU-Pro77.368.7
multichallenge5655.3
MultiNRC57.135.8
Needle-in-a-Haystack (8-needle 1M variant)7618.5
OmniDocBench 1.586.685.8
OmniScience Accuracy4732.9
OmniScience Non-Hallucination37.250.9
OSWorld-Verified72.761.4
RealWorldQA73.970.3
scicode5245
SEAL VISTA46.148.8
simplebench67.654.3
simpleqa_verified46.523.6
swe_bench_bash75.671.4
SWE-bench Multilingual77.868
SWE-bench Pro57.343.6
SWE-bench Verified80.882
Terminal-Bench 2.065.450
Terminal-Bench Hard65.435.6
toolathlon56.841
Toolathlon Avg turns16.932
Toolathlon Pass@∞47.228.7
vectara_answer_rate99.895.6
vectara_avg_summary_length137.6127.8
vectara_factual_consistency87.888
vectara_hallucination_rate12.212
VisualToolBench27.56.2
τ²-Bench Telecom (AA run)99.378.1
τ³-Bench72.419

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.