VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-R1 vs DeepSeek-V3

DeepSeekvsDeepSeek63 shared benchmarks5211 head-to-head
BenchmarkDeepSeek-R1DeepSeek-V3
AA Agentic Index3.11.6
AA Intelligence18.615.4
AA-LCR5641.3
AA-Omniscience-31.3-37.6
aider_polyglot71.655.1
AIME 202491.459.4
AIME 202587.551.3
AIR-Bench 202452.940.8
AlpacaEval2.0 (LC-winrate)87.670
anthropic_red_team99.197.1
Arena-Hard (GPT-4-1106 judge)92.385.5
ArenaHard (GPT-4-1106)92.385.5
Artificial Analysis Coding Index24.623
bbq96.696.7
C-Eval91.890.1
Chinese SimpleQA (C-SimpleQA)63.768
CLUEWSC92.890.9
CNMO 202478.874.7
Codeforces20291134
Codeforces (Percentile)96.358.7
Codeforces (Rating)20291134
critpt0.60
DROP (3-shot F1)92.291.6
FRAMES (Acc.)8373.3
gdpval1.50
GPQA Diamond8168.4
harmbench54.649.7
HLE17.75.2
HMMT 202579.427.5
hmmt_feb_202576.729.2
IFBench3941
ifeval83.387.3
LiveCodeBench84.449.6
livecodebench_easy99.283.3
livecodebench_hard63.614.2
livecodebench_medium90.953.5
livecodebench_pass1cot65.940.5
longbench_v258.348.7
MATH97.391.2
math_500_em9894
mmlu92.989.4
mmlu_prox75.570.5
mmlu_redux93.490.5
MMLU-Pro8581.2
multichallenge4531.4
OmniScience Accuracy30.725.4
OmniScience Non-Hallucination10.523.3
scicode35.735.8
simple_safety_tests98.395.3
simplebench40.827.2
simpleqa92.327.7
SWE-bench Verified57.642
TauBench V3 - Banking6.44.7
Terminal-Bench 2.119.116.9
Terminal-Bench Hard6.115.2
vectara_answer_rate9797.5
vectara_avg_summary_length93.581.7
vectara_factual_consistency88.793.9
vectara_hallucination_rate11.36.1
xstest98.897.1
ZebraLogic95.184
τ²-Bench Telecom (AA run)11.447.1
τ³-Bench6.44.7

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.