VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 3.7 Sonnet vs o3

AnthropicvsOpenAI41 shared benchmarks1130 head-to-head
BenchmarkClaude 3.7 Sonneto3
AA Agentic Index3736.1
AA Intelligence27.631.1
AA-LCR62.373.3
AA-Omniscience-0.7-15.3
aider_polyglot64.981.3
AIME 202554.889.2
AIR-Bench 202481.884.5
anthropic_red_team99.798.3
arc_agi_113.660.8
ARC-AGI-206.5
arena_vision11951217
Artificial Analysis Coding Index36.438.4
bbq92.197.9
critpt0.91.1
Fortress3816
gdpval27.412.8
GPQA Diamond84.883.3
harmbench84.398.4
HLE9.720.3
hmmt_feb_202531.777.5
IFBench48.371.4
math_500_em96.298.1
metr_hcast54.264.7
metr_re_bench015
metr_swaa98.799.8
MMMU7582.9
MMMU-Pro60.176.4
multichallenge51.660.4
MultiNRC27.845.5
OmniScience Accuracy28.238.6
OmniScience Non-Hallucination6012.9
scicode40.341
simple_safety_tests10099
simplebench46.453.1
swe_bench_bash52.858.4
SWE-bench Verified70.369.1
TAU-bench (airline)58.452
TAU-bench (retail)81.273.9
Terminal-Bench Hard21.237.1
xstest96.497.3
τ²-Bench Telecom (AA run)54.780.7

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.