VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-4o vs Llama 3.1 Instruct 405B

OpenAIvsMeta56 shared benchmarks4212 head-to-head
BenchmarkGPT-4oLlama 3.1 Instruct 405B
AA Agentic Index9.76.3
AA Intelligence11.28.5
AA-LCR5524.7
AA-Omniscience-10.5-17.1
aider_edit_acc72.963.9
aider_polyglot30.75.8
AIME 20249.323.3
AIR-Bench 202462.458.6
anthropic_red_team99.196.5
Arena Hard92.469.3
Artificial Analysis Coding Index24.214.5
bbq95.194.5
C-Eval7672.5
Chinese SimpleQA (C-SimpleQA)64.654.7
CLUEWSC87.984.7
Codeforces75925.3
critpt00
DROP83.484.8
DROP (3-shot F1)83.788.7
DROP (F1)89.292.5
Fortress47.220.6
FRAMES (Acc.)80.570
gdpval00
GPQA Diamond70.151.5
GSM8K95.696.8
harmbench82.962.7
HLE5.34.2
humaneval90.689
HumanEval-Mul (Pass@1)80.577.2
IFBench3639
ifeval84.388.6
IFEval (avg)84.186.4
LiveCodeBench38.330.1
livecodebench_pass1cot34.228.4
longbench_v248.136.1
MATH85.382.7
math_500_em74.673.8
MBPP+ (EvalPlus-augmented)76.273
mgsm90.591.6
mmlu88.188.6
mmlu_redux8886.2
MMLU-Pro74.773.4
mmmlu81.473.8
narrativeqa80.474.9
naturalquestions_closedbook50.145.6
OmniScience Accuracy23.723.2
OmniScience Non-Hallucination62.149
OpenBookQA96.894
scicode33.429.9
simple_safety_tests98.598.8
simplebench17.823
simpleqa39.423.2
SWE-bench Verified38.824.5
Terminal-Bench Hard8.36.8
xstest97.395.9
τ²-Bench Telecom (AA run)28.919

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.