VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 3.5 Sonnet vs GPT-4o

AnthropicvsOpenAI103 shared benchmarks5350 head-to-head
BenchmarkClaude 3.5 SonnetGPT-4o
AA Intelligence1011.2
AI2D94.794.2
aider_edit_acc84.272.9
aider_polyglot45.330.7
AIME 2024169.3
AIME 20257.411.7
AIR-Bench 202485.962.4
AlpacaEval2.0 (LC-winrate)5251.1
anthropic_red_team99.899.1
Arena Hard87.692.4
arena_vision11461162
Arena-Hard (GPT-4-1106 judge)85.280.4
ArenaHard (GPT-4-1106)85.280.4
Artificial Analysis Coding Index30.224.2
bbq94.995.1
C-Eval76.776
chartqa90.888.1
ChartQA_relaxed90.888.1
Chinese SimpleQA (C-SimpleQA)56.864.6
CLUEWSC85.487.9
CNMO 202413.110.8
Codeforces717759
Codeforces (Percentile)20.323.6
Codeforces (Rating)717759
docvqa95.292.8
DocVQA_test95.292.8
DROP87.183.4
DROP (3-shot F1)88.383.7
DROP (F1)88.889.2
Fortress1347.2
FRAMES (Acc.)72.580.5
GPQA Diamond67.270.1
GSM8K96.995.6
HallBench_avg49.955
harmbench98.182.9
HLE3.95.3
humaneval93.790.6
HumanEval-Mul (Pass@1)81.780.5
ifeval90.184.3
IFEval (avg)90.184.1
LiveCodeBench32.838.3
LiveCodeBench v637.230.9
livecodebench_pass1cot36.334.2
LongBench v2 easy (w/ CoT)55.254.2
LongBench v2 easy (w/o CoT)46.957.4
LongBench v2 hard (w/ CoT)41.549.7
LongBench v2 hard (w/o CoT)37.345.6
LongBench v2 long (w/ CoT)44.443.5
LongBench v2 long (w/o CoT)3740.2
LongBench v2 medium (w/ CoT)41.948.6
LongBench v2 medium (w/o CoT)38.652.4
LongBench v2 overall (w/ CoT)46.751.4
LongBench v2 overall (w/o CoT)4150.1
LongBench v2 short (w/ CoT)53.959.6
LongBench v2 short (w/o CoT)46.153.3
longbench_v24148.1
M-LongDoc (multimodal long-document benchmark)31.441.4
MATH81.385.3
math_500_em78.374.6
MATH500 (Pass@1)78.374.6
MathVista67.763.8
MBPP+ (EvalPlus-augmented)75.176.2
MEGA-Bench_macro51.449.4
mgsm91.690.5
MMBench-CN_test80.782.1
MMBench-EN_test79.783.4
MMBench-V1.1_test78.582.2
MME_sum19202329
mmlu88.388.1
mmlu_redux88.988
MMLU-Pro7874.7
MMMU7272.2
MMMU (val) (Pass@1)68.369.1
MMMU-Pro54.759.9
MMStar62.263.9
MMVet_GPT-4-Turbo6669.1
MTOB eng → kalam (ChrF) half book53.654.3
MTOB eng → kalam (ChrF) no context20.29.9
MTOB kalam → eng (BLEURT) half book59.758.3
MTOB kalam → eng (BLEURT) no context31.433.2
narrativeqa74.680.4
naturalquestions_closedbook50.250.1
OCRBench790806
OlympiadBench28.425.2
OpenBookQA97.296.8
RealWorldQA60.175.4
Ruler 16k95.789
Ruler 32k9588.8
Ruler 4k96.597
RULER 64K95.288.4
Ruler 8k9692.1
scicode36.633.4
SEAL VISTA38.734.9
simple_safety_tests10098.5
simplebench41.417.8
simpleqa28.439.4
supergpqa48.242.4
SWE-bench Verified50.838.8
TAU-bench (airline)4642.8
TAU-bench (retail)69.260.3
VCR_en easy63.991.5
VCR_zh easy114.9
xstest95.697.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.