VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.5 vs Claude Sonnet 4.6

AnthropicvsAnthropic47 shared benchmarks1631 head-to-head
BenchmarkClaude Opus 4.5Claude Sonnet 4.6
AA Agentic Index59.661.6
AA Intelligence41.948.4
AA-LCR7674
AA-Omniscience1412.2
arc_agi_18286.5
ARC-AGI-237.660.4
arena_elo14731472
arena_text_factuality14581460
Artificial Analysis Coding Index47.863
browsecomp3776.2
charxiv_rq68.572.4
coding_arena_elo14951523
critpt4.63.1
finance_agent55.263.3
frontiermath_tier_44.28.3
gdpval47.354.8
GPQA Diamond8789.9
HLE30.849
HLE (with tools)43.446.8
IFBench5856.6
livebench7675.5
livebench_agentic_coding39.742.6
livebench_coding79.779.3
livebench_data_analysis74.478
livebench_instruction_following62.563.2
livebench_language81.376.1
livebench_math90.487
livebench_reasoning80.184.8
MCP Atlas69.869.5
mmmlu90.889.3
MMMU-Pro7475.6
OmniScience Accuracy46.640.9
OmniScience Non-Hallucination3951.6
OSWorld-Verified66.378.5
scicode5047
simpleqa_verified41.829
SWE-bench Pro57.158.1
SWE-bench Verified81.579.6
Tau2 retail88.991.7
Terminal-Bench 2.059.359.1
Terminal-Bench Hard4759.1
toolathlon43.549.4
vectara_answer_rate98.799.9
vectara_avg_summary_length114.5114.7
vectara_factual_consistency89.189.4
vectara_hallucination_rate10.910.6
τ²-Bench Telecom (AA run)89.597.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.