VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 4 Opus vs DeepSeek-V3

AnthropicvsDeepSeek52 shared benchmarks4111 head-to-head
BenchmarkClaude 4 OpusDeepSeek-V3
AA Intelligence31.715.4
AA-LCR4041.3
AceBench75.672.7
aider_polyglot70.755.1
AIME 20247659.4
AIME 202575.551.3
AIR-Bench 202485.740.8
anthropic_red_team98.997.1
Artificial Analysis Coding Index3423
AutoLogi86.188.9
bbq99.396.7
CNMO 202457.674.7
GPQA Diamond79.668.4
harmbench91.749.7
HLE12.35.2
HMMT 202515.927.5
hmmt_feb_20256029.2
IFBench53.741
ifeval87.487.3
livebench74.672.4
LiveCodeBench70.449.6
LiveCodeBench v647.446.9
livecodebench_easy99.183.3
livecodebench_hard33.114.2
livecodebench_medium80.453.5
longbench_v255.648.7
math_500_em98.294
mmlu92.989.4
mmlu_redux94.290.5
MMLU-Pro86.681.2
mmmlu88.879.4
multichallenge58.631.4
MultiPL-E89.683.1
OJBench19.624
PolyMath-en49.859.5
scicode40.935.8
simple_safety_tests10095.3
simplebench58.827.2
simpleqa22.827.7
supergpqa56.553.7
SWE-bench Verified79.442
Tau2 airline6039
Tau2 retail81.869.1
Terminal-Bench Hard31.115.2
vectara_answer_rate9197.5
vectara_avg_summary_length123.281.7
vectara_factual_consistency8893.9
vectara_hallucination_rate126.1
xstest9797.1
ZebraLogic95.184
τ²-Bench5732.5
τ²-Bench Telecom (AA run)73.447.1

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.