VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-V3 vs Qwen2.5 Instruct 72B

DeepSeekvsAlibaba94 shared benchmarks7914 head-to-head
BenchmarkDeepSeek-V3Qwen2.5 Instruct 72B
AA Intelligence15.410
AA-LCR41.320.3
AA-Omniscience-37.6-52.2
AGIEval79.675.8
aider_edit_acc79.765.4
aider_polyglot55.17.6
AIME 202459.423.3
AIR-Bench 202440.859
anthropic_red_team97.199.6
arc_challenge95.394.5
ARC-Challenge (Acc.)95.394.5
ARC-Easy (Acc.)98.998.4
Arena Hard91.481.2
Artificial Analysis Coding Index2311.9
bbh87.579.8
BBH (EM)87.579.8
bbq96.795.4
C-Eval90.189.2
C378.676.7
C3 (Acc.)78.676.7
CCPM9288.5
Chinese SimpleQA (C-SimpleQA)6852.2
CLUEWSC90.991.4
CMath (EM)90.784.5
cmmlu88.889.5
CMMLU (Acc.)88.889.5
CMRC76.375.8
Codeforces113424.8
critpt00
CRUXEval-I (Acc.)67.359.1
CRUXEval-I (input prediction)67.359.1
CRUXEval-O (Acc.)69.859.9
CRUXEval-O (output prediction)69.859.9
DROP91.676.7
DROP (3-shot F1)91.676.7
DROP (F1)9185
FRAMES (Acc.)73.369.8
GPQA Diamond68.449.1
GSM8K96.795.8
GSM8K (EM)89.388.3
harmbench49.772.8
hellaswag88.984.8
HellaSwag (Acc.)88.984.8
HLE5.24.2
humaneval92.186.6
HumanEval-Mul (Pass@1)82.677.3
IFBench4136.9
ifeval87.387.2
IFEval (avg)87.387.2
livebench72.452.3
LiveCodeBench49.655.5
livecodebench_pass1cot40.531.1
LiveCodeBench-Base (Pass@1)19.412.9
LongBench v2 overall (w/o CoT)48.742.1
longbench_v248.739.4
MATH91.288.4
MATH (EM)61.654.4
math_500_em9480
MBPP75.472.6
MBPP+ (EvalPlus-augmented)78.877
mgsm79.887.3
MGSM (EM)79.876.2
mmlu89.486.1
MMLU (Acc.)87.185
mmlu_redux90.586.8
MMLU-Pro81.271.6
MMLU-Pro (Acc.)64.458.3
MMLU-Redux (Acc.)86.283.2
mmmlu79.474.8
MMMLU-non-English (Acc.)79.474.8
MultiPL-E83.175.1
narrativeqa79.674.5
NaturalQuestions4033.2
NaturalQuestions (EM)4033.2
naturalquestions_closedbook46.735.9
OmniScience Accuracy25.417.6
OmniScience Non-Hallucination23.315.3
OpenBookQA95.496.2
Pile-test (BPB)0.50.6
PIQA84.782.6
PIQA (Acc.)84.782.6
RACE-High51.350.3
RACE-Middle67.168.1
scicode35.826.7
simple_safety_tests95.3100
simpleqa27.710.3
SWE-bench Verified4223.8
Terminal-Bench Hard15.24.5
The Pile (Test, BPB)0.50.6
TriviaQA (EM)82.971.9
winogrande84.982.3
WinoGrande (Acc.)84.982.3
xstest97.197.9
τ²-Bench Telecom (AA run)47.134.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.