VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 4 Opus vs DeepSeek-R1

AnthropicvsDeepSeek50 shared benchmarks2523 head-to-head
BenchmarkClaude 4 OpusDeepSeek-R1
AA Intelligence31.718.6
AA-LCR4056
aider_polyglot70.771.6
AIME 20247691.4
AIME 202575.587.5
AIR-Bench 202485.752.9
anthropic_red_team98.999.1
arc_agi_12721.2
ARC-AGI-28.61.3
Artificial Analysis Coding Index3424.6
bbq99.396.6
CNMO 202457.678.8
Fortress27.674.4
FullStackBench70.370.1
GPQA Diamond79.681
harmbench91.754.6
HLE12.317.7
HMMT 202515.979.4
hmmt_feb_20256076.7
IFBench53.739
ifeval87.483.3
LiveCodeBench70.484.4
LiveCodeBench (24/8~25/5)56.673.1
livecodebench_easy99.199.2
livecodebench_hard33.163.6
livecodebench_medium80.490.9
longbench_v255.658.3
math_500_em98.298
mmlu92.992.9
mmlu_redux94.293.4
MMLU-Pro86.685
multichallenge58.645
MultiNRC33.927.6
OpenAI-MRCR (128k)48.951.5
scicode40.935.7
simple_safety_tests10098.3
simplebench58.840.8
simpleqa22.892.3
SWE-bench Verified79.457.6
TAU-bench (airline)59.653.5
TAU-bench (retail)81.463.9
Terminal-Bench43.25.7
Terminal-Bench Hard31.16.1
vectara_answer_rate9197
vectara_avg_summary_length123.293.5
vectara_factual_consistency8888.7
vectara_hallucination_rate1211.3
xstest9798.8
ZebraLogic95.195.1
τ²-Bench Telecom (AA run)73.411.4

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.