VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-V3 vs Llama 3.1 Instruct 405B

DeepSeekvsMeta94 shared benchmarks6823 head-to-head
BenchmarkDeepSeek-V3Llama 3.1 Instruct 405B
AA Agentic Index1.66.3
AA Intelligence15.48.5
AA-LCR41.324.7
AA-Omniscience-37.6-17.1
AGIEval79.660.6
aider_edit_acc79.763.9
aider_polyglot55.15.8
AIME 202459.423.3
AIR-Bench 202440.858.6
anthropic_red_team97.196.5
arc_challenge95.396.9
ARC-Challenge (Acc.)95.395.3
ARC-Easy (Acc.)98.998.4
Arena Hard91.469.3
Artificial Analysis Coding Index2314.5
bbh87.585.9
BBH (EM)87.582.9
bbq96.794.5
C-Eval90.172.5
C378.679.7
C3 (Acc.)78.679.7
CCPM9278.6
Chinese SimpleQA (C-SimpleQA)6854.7
CLUEWSC90.984.7
CMath (EM)90.777.3
cmmlu88.873.7
CMMLU (Acc.)88.873.7
CMRC76.376
Codeforces113425.3
critpt00
CRUXEval-I (Acc.)67.358.5
CRUXEval-I (input prediction)67.358.5
CRUXEval-O (Acc.)69.859.9
CRUXEval-O (output prediction)69.859.9
DROP91.684.8
DROP (3-shot F1)91.688.7
DROP (F1)9192.5
FRAMES (Acc.)73.370
gdpval00
GPQA Diamond68.451.5
GSM8K96.796.8
GSM8K (EM)89.383.5
harmbench49.762.7
hellaswag88.989.2
HellaSwag (Acc.)88.989.2
HLE5.24.2
humaneval92.189
HumanEval-Mul (Pass@1)82.677.2
IFBench4139
ifeval87.388.6
IFEval (avg)87.386.4
LiveCodeBench49.630.1
livecodebench_pass1cot40.528.4
LiveCodeBench-Base (Pass@1)19.415.5
longbench_v248.736.1
MATH91.282.7
MATH (EM)61.649
math_500_em9473.8
MBPP75.473.4
MBPP+ (EvalPlus-augmented)78.873
mgsm79.891.6
MGSM (EM)79.869.9
mmlu89.488.6
MMLU (Acc.)87.184.4
mmlu_redux90.586.2
MMLU-Pro81.273.4
MMLU-Pro (Acc.)64.452.8
MMLU-Redux (Acc.)86.281.3
mmmlu79.473.8
MMMLU-non-English (Acc.)79.473.8
narrativeqa79.674.9
NaturalQuestions4041.5
NaturalQuestions (EM)4041.5
naturalquestions_closedbook46.745.6
OmniScience Accuracy25.423.2
OmniScience Non-Hallucination23.349
OpenBookQA95.494
Pile-test (BPB)0.50.5
PIQA84.785.9
PIQA (Acc.)84.785.9
RACE-High51.356.8
RACE-Middle67.174.2
scicode35.829.9
simple_safety_tests95.398.8
simplebench27.223
simpleqa27.723.2
SWE-bench Verified4224.5
Terminal-Bench Hard15.26.8
The Pile (Test, BPB)0.50.5
TriviaQA (EM)82.982.7
winogrande84.986.7
WinoGrande (Acc.)84.985.2
xstest97.195.9
τ²-Bench Telecom (AA run)47.119

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.