VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Llama 3.1 Instruct 405B vs Qwen2.5 Instruct 72B

MetavsAlibaba94 shared benchmarks4642 head-to-head
BenchmarkLlama 3.1 Instruct 405BQwen2.5 Instruct 72B
AA Intelligence8.510
AA-LCR24.720.3
AA-Omniscience-17.1-52.2
AGIEval60.675.8
aider_edit_acc63.965.4
aider_polyglot5.87.6
AIME 202423.323.3
AIR-Bench 202458.659
AlignBench681.6
anthropic_red_team96.599.6
arc_challenge96.994.5
ARC-Challenge (Acc.)95.394.5
ARC-Easy (Acc.)98.498.4
Arena Hard69.381.2
Artificial Analysis Coding Index14.511.9
bbh85.979.8
BBH (EM)82.979.8
bbq94.595.4
C-Eval72.589.2
C379.776.7
C3 (Acc.)79.776.7
CCPM78.688.5
Chinese SimpleQA (C-SimpleQA)54.752.2
CLUEWSC84.791.4
CMath (EM)77.384.5
cmmlu73.789.5
CMMLU (Acc.)73.789.5
CMRC7675.8
Codeforces25.324.8
critpt00
CRUXEval-I (Acc.)58.559.1
CRUXEval-I (input prediction)58.559.1
CRUXEval-O (Acc.)59.959.9
CRUXEval-O (output prediction)59.959.9
DROP84.876.7
DROP (3-shot F1)88.776.7
DROP (F1)92.585
Fortress20.656.4
FRAMES (Acc.)7069.8
GPQA Diamond51.549.1
GSM8K96.895.8
GSM8K (EM)83.588.3
harmbench62.772.8
hellaswag89.284.8
HellaSwag (Acc.)89.284.8
HLE4.24.2
humaneval8986.6
HumanEval-Mul (Pass@1)77.277.3
IFBench3936.9
ifeval88.687.2
IFEval (avg)86.487.2
LiveCodeBench30.155.5
livecodebench_pass1cot28.431.1
LiveCodeBench-Base (Pass@1)15.512.9
longbench_v236.139.4
MATH82.788.4
MATH (EM)4954.4
math_500_em73.880
MBPP73.472.6
MBPP+ (EvalPlus-augmented)7377
mgsm91.687.3
MGSM (EM)69.976.2
mmlu88.686.1
MMLU (Acc.)84.485
mmlu_redux86.286.8
MMLU-Pro73.471.6
MMLU-Pro (Acc.)52.858.3
MMLU-Redux (Acc.)81.383.2
mmmlu73.874.8
MMMLU-non-English (Acc.)73.874.8
mt_bench9.10.9
narrativeqa74.974.5
NaturalQuestions41.533.2
NaturalQuestions (EM)41.533.2
naturalquestions_closedbook45.635.9
OmniScience Accuracy23.217.6
OmniScience Non-Hallucination4915.3
OpenBookQA9496.2
Pile-test (BPB)0.50.6
PIQA85.982.6
PIQA (Acc.)85.982.6
RACE-High56.850.3
RACE-Middle74.268.1
scicode29.926.7
simple_safety_tests98.8100
simpleqa23.210.3
SWE-bench Verified24.523.8
Terminal-Bench Hard6.84.5
The Pile (Test, BPB)0.50.6
TriviaQA (EM)82.771.9
winogrande86.782.3
WinoGrande (Acc.)85.282.3
xstest95.997.9
τ²-Bench Telecom (AA run)1934.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.