VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 3.5 Sonnet vs Gemini 1.5 Pro

AnthropicvsGoogle67 shared benchmarks3827 head-to-head
BenchmarkClaude 3.5 SonnetGemini 1.5 Pro
AA Intelligence1010
AI2D94.780.9
aider_polyglot45.316.9
AIR-Bench 202485.982.8
anthropic_red_team99.899.9
Arena Hard87.685.3
arena_vision11461179
Artificial Analysis Coding Index30.223.6
bbh93.189.2
bbq94.994.5
BLINK56.561
chartqa90.888.7
ChartQA_relaxed90.888.7
Chinese SimpleQA (C-SimpleQA)56.859.4
docvqa95.291.5
DROP87.174.9
DROP (F1)88.889.2
Fortress1353.9
GPQA Diamond67.259.1
GSM8K96.995.2
harmbench98.179.9
HLE3.94.9
humaneval93.786.6
ifeval90.189.4
IFEval (avg)90.189.4
InterGPS (test)45.658.2
LiveCodeBench32.830.5
M-LongDoc (multimodal long-document benchmark)31.426.2
MATH81.392
MathVista67.770.6
MBPP+ (EvalPlus-augmented)75.175.4
MEGA-Bench_macro51.445.9
mgsm91.687.5
MMBench (dev-en)82.387.9
mmlu88.386.8
MMLU-Pro7875.8
MMMU7268.4
MMMU (val) (Pass@1)68.354.1
MMMU-Pro54.755
MTOB eng → kalam (ChrF) full book55.657.9
MTOB eng → kalam (ChrF) half book53.653.7
MTOB eng → kalam (ChrF) no context20.216.8
MTOB kalam → eng (BLEURT) full book62.363.1
MTOB kalam → eng (BLEURT) half book59.761.5
MTOB kalam → eng (BLEURT) no context31.432
narrativeqa74.678.3
naturalquestions_closedbook50.245.5
OCRBench790800
OlympiadBench28.432.1
OpenBookQA97.295.2
POPE (test)76.689.3
RULER 128K93.891.7
Ruler 16k95.796
Ruler 32k9595.8
Ruler 4k96.596.2
RULER 64K95.293.8
Ruler 8k9696
scicode36.629.5
ScienceQA (img-test)73.886
SEAL VISTA38.737.1
simple_safety_tests10097.5
simplebench41.427.1
simpleqa28.423.4
SWE-bench Verified50.834.2
TextVQA (val)70.564.5
Video-MME Overall55.962.6
xstest95.698.8

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.