VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 4 Opus vs o3

AnthropicvsOpenAI49 shared benchmarks1829 head-to-head
BenchmarkClaude 4 Opuso3
AA Intelligence31.731.1
AA-LCR4073.3
aider_polyglot70.781.3
AIME 20247691.6
AIME 202575.589.2
AIR-Bench 202485.784.5
anthropic_red_team98.998.3
arc_agi_12760.8
ARC-AGI-28.66.5
arena_vision12071217
Artificial Analysis Coding Index3438.4
bbq99.397.9
Fortress27.616
frontiermath_tier_44.22.1
FullStackBench70.369.3
GPQA Diamond79.683.3
harmbench91.798.4
HLE12.320.3
hmmt_feb_20256077.5
IFBench53.771.4
LiveCodeBench70.484.7
LiveCodeBench (24/8~25/5)56.675.8
livecodebench_easy99.199.1
livecodebench_hard33.166
livecodebench_medium80.489.8
longbench_v255.658.8
math_500_em98.298.1
metr_hcast61.764.7
metr_re_bench2015
metr_swaa99.899.8
MMLU-Pro86.685
MMMU73.782.9
multichallenge58.660.4
MultiNRC33.945.5
OpenAI-MRCR (128k)48.956.5
scicode40.941
simple_safety_tests10099
simplebench58.853.1
simpleqa22.849.4
swe_bench_bash67.658.4
SWE-bench Verified79.469.1
TAU-bench (airline)59.652
TAU-bench (retail)81.473.9
Tau2 airline6064.8
Tau2 retail81.880.2
Terminal-Bench Hard31.137.1
xstest9797.3
ZebraLogic95.195.8
τ²-Bench Telecom (AA run)73.480.7

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.