VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.5 vs Claude Opus 4.6

AnthropicvsAnthropic75 shared benchmarks1956 head-to-head
BenchmarkClaude Opus 4.5Claude Opus 4.6
AA Agentic Index59.667.6
AA Intelligence41.944.9
AA-LCR7674.3
AA-Omniscience1413.7
AIME 202592.899.8
aime_202695.196.7
AIME25 no tools9195.6
arc_agi_18293
ARC-AGI-237.668.8
arena_elo14731497
arena_text_factuality14581487
Artificial Analysis Coding Index47.848.1
browsecomp3786.8
browsecomp_with_context_manager67.884
charxiv_rq68.569.1
coding_arena_elo14951545
critpt4.612.6
cybergym50.673.8
deepsearchqa_f176.191.3
ERQA46.840.8
finance_agent55.276.7
Fortress13.620.5
frontiermath_tier_44.222.9
gdpval47.355.9
GPQA Diamond8791.3
HLE30.853.1
HLE (with tools)43.462.7
hmmt_feb_202685.396.2
hmmt_nov_202593.396.3
IFBench5862.5
imo_answer_bench8475.3
livebench7676.3
livebench_agentic_coding39.749
livebench_coding79.778.2
livebench_data_analysis74.469.9
livebench_instruction_following62.563.3
livebench_language81.383.3
livebench_math90.489.3
livebench_reasoning80.188.7
LiveCodeBench8788.8
LiveCodeBench v684.888.8
mathvision77.171.2
MCP Atlas69.876.8
metr_hcast73.477
metr_re_bench4097.4
metr_swaa99.598.5
MMLU-Pro9089.1
mmmlu90.891.1
MMMU-Pro7477.3
multichallenge5956
MultiNRC48.657.1
nl2repo43.249.8
OmniDocBench 1.587.786.6
OmniScience Accuracy46.647
OmniScience Non-Hallucination3937.2
OSWorld-Verified66.372.7
RealWorldQA7773.9
scicode5052
SEAL VISTA46.446.1
simplebench6267.6
simpleqa_verified41.846.5
swe_bench_bash76.875.6
SWE-bench Multilingual77.577.8
SWE-bench Pro57.157.3
SWE-bench Verified81.580.8
Tau2 retail88.991.9
Terminal-Bench 2.059.365.4
Terminal-Bench Hard4765.4
tool_decathlon43.547.2
toolathlon43.556.8
vectara_answer_rate98.799.8
vectara_avg_summary_length114.5137.6
vectara_factual_consistency89.187.8
vectara_hallucination_rate10.912.2
τ²-Bench Telecom (AA run)89.599.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.