VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.5 vs DeepSeek-V3.2

AnthropicvsDeepSeek63 shared benchmarks5111 head-to-head
BenchmarkClaude Opus 4.5DeepSeek-V3.2
AA Agentic Index59.639.8
AA Intelligence41.932.8
AA-LCR7670.7
AA-Omniscience14-22.5
AIME 202592.893.1
AIME 2026 I93.392.7
aime_202695.195.1
AIME25 no tools9189.3
arc_agi_18257
ARC-AGI-237.64
arena_text_factuality14581433
Artificial Analysis Coding Index47.844.2
browsecomp3751.4
BrowseComp (context management)59.267.6
browsecomp_with_context_manager67.867.6
browsecomp_zh62.465
coding_arena_elo14951368
critpt4.62.9
cybergym50.617.3
deepsearchqa_f176.160.9
FinSearchCompT2&T366.259.1
frontiermath_tier_44.22.1
gdpval47.318.8
GPQA Diamond8784
HLE30.840.8
HLE (with tools)43.440.8
hmmt_feb_202592.992.5
hmmt_feb_202685.384.1
hmmt_nov_202593.390.2
IFBench5861
imo_answer_bench8478.3
LiveCodeBench8786
LiveCodeBench v684.883.3
longbench_v264.459.8
MCP Atlas69.862.2
mmlu_redux95.693.7
MMLU-Pro9086
Multi-SWE-Bench5037.4
OctoCodingbench36.226
OJ-Bench (cpp)54.654.7
OmniScience Accuracy46.633
OmniScience Non-Hallucination3917.3
PaperBench72.947.1
scicode5039
Seal-047.749.5
simpleqa_verified41.827.5
swe_bench_bash76.860
SWE-bench Multilingual77.570.2
SWE-bench Pro57.115.6
SWE-bench Verified81.573.1
SWE-Perf4.70.9
SWT-bench80.262
Terminal-Bench 2.059.346.4
Terminal-Bench Hard4735.6
tool_decathlon43.535.2
toolathlon43.535.2
vectara_answer_rate98.792.6
vectara_avg_summary_length114.562
vectara_factual_consistency89.193.7
vectara_hallucination_rate10.96.3
WideSearch (item-f1)76.232.5
τ²-Bench98.291
τ²-Bench Telecom (AA run)89.590.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.