VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 4 Opus vs GPT-5

AnthropicvsOpenAI43 shared benchmarks1033 head-to-head
BenchmarkClaude 4 OpusGPT-5
AA Intelligence31.735.3
AA-LCR4076.3
aider_polyglot70.788
AIME33.97.6
AIME 202575.595
AIR-Bench 202485.787.7
arc_agi_12756.2
ARC-AGI-28.67.5
arena_vision12071212
Artificial Analysis Coding Index3438.9
Fortress27.617
frontiermath_tier_44.212.5
GPQA Diamond79.687.3
harmbench91.770
HLE12.328.5
HMMT 202515.993.3
hmmt_feb_20256088.3
IFBench53.773.1
LiveCodeBench70.485
LiveCodeBench v647.487
metr_hcast61.768.4
metr_re_bench2040
metr_swaa99.8100
mmlu_redux94.295.3
MMLU-Pro86.687.5
MMMU73.784.2
multichallenge58.671.1
MultiNRC33.952.1
scicode40.943
SEAL VISTA4749.7
simplebench58.856.7
swe_bench_bash67.665
SWE-bench Verified79.474.9
Tau2 airline6062.6
Tau2 retail81.881.1
Terminal-Bench43.243.8
Terminal-Bench Hard31.137.9
vectara_answer_rate9199.9
vectara_avg_summary_length123.2162.7
vectara_factual_consistency8885.3
vectara_hallucination_rate1214.7
τ²-Bench5785
τ²-Bench Telecom (AA run)73.486.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.