VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 4 Opus vs GPT-4o

AnthropicvsOpenAI55 shared benchmarks478 head-to-head
BenchmarkClaude 4 OpusGPT-4o
AA Intelligence31.711.2
AA-LCR4055
aider_polyglot70.730.7
AIME 2024769.3
AIME 202575.511.7
AIR-Bench 202485.762.4
anthropic_red_team98.999.1
arc_agi_1274.5
ARC-AGI-28.60
arena_vision12071162
Artificial Analysis Coding Index3424.2
bbq99.395.1
CNMO 202457.610.8
Fortress27.647.2
GPQA Diamond79.670.1
harmbench91.782.9
HLE12.35.3
IFBench53.736
ifeval87.484.3
LiveCodeBench70.438.3
LiveCodeBench v647.430.9
livecodebench_easy99.182.5
livecodebench_hard33.14.5
livecodebench_medium80.432.1
longbench_v255.648.1
math_500_em98.274.6
metr_hcast61.725
metr_re_bench200
metr_swaa99.899.2
mmlu92.988.1
mmlu_redux94.288
MMLU-Pro86.674.7
mmmlu88.881.4
MMMU73.772.2
multichallenge58.640.3
MultiNRC33.912.4
scicode40.933.4
SEAL VISTA4734.9
simple_safety_tests10098.5
simplebench58.817.8
simpleqa22.839.4
supergpqa56.542.4
swe_bench_bash67.621.6
SWE-bench Verified79.438.8
TAU-bench (airline)59.642.8
TAU-bench (retail)81.460.3
Tau2 airline6045.5
Tau2 retail81.863.4
Terminal-Bench Hard31.18.3
vectara_answer_rate9193.8
vectara_avg_summary_length123.286.6
vectara_factual_consistency8890.4
vectara_hallucination_rate129.6
xstest9797.3
τ²-Bench Telecom (AA run)73.428.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.