VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude 4 Opus vs Claude Sonnet 4

AnthropicvsAnthropic63 shared benchmarks3424 head-to-head
BenchmarkClaude 4 OpusClaude Sonnet 4
AA Intelligence31.729.8
AA-LCR4069.7
AceBench75.676.2
aider_polyglot70.770.7
AIME33.933.1
AIME 20247643.4
AIME 202575.574
AIR-Bench 202485.788.3
anthropic_red_team98.999.2
arc_agi_12763.7
ARC-AGI-28.613.6
arena_vision12071207
Artificial Analysis Coding Index3437.6
AutoLogi86.189.8
bbq99.397.9
CNMO 202457.660.4
Fortress27.624.4
frontiermath_tier_44.20
GPQA Diamond79.678
harmbench91.798
HLE12.310.7
HMMT 202515.915.9
IFBench53.755
ifeval87.487.6
livebench74.674.8
LiveCodeBench70.468.5
LiveCodeBench v647.448.5
livecodebench_easy99.198.8
livecodebench_hard33.132.6
livecodebench_medium80.476
math_500_em98.294
mmlu92.991.5
mmlu_redux94.293.6
MMLU-Pro86.684
mmmlu88.886.5
MMMU73.774.4
multichallenge58.657.1
MultiNRC33.918.4
MultiPL-E89.688.6
OJBench19.615.3
PolyMath-en49.852.8
scicode40.940
SEAL VISTA4745.5
simple_safety_tests100100
simplebench58.845.5
simpleqa22.815.9
supergpqa56.555.7
swe_bench_bash67.664.9
SWE-bench Verified79.480.2
TAU-bench (airline)59.660
TAU-bench (retail)81.480.5
Tau2 airline6055.5
Tau2 retail81.875
Terminal-Bench43.236.4
Terminal-Bench Hard31.131.1
vectara_answer_rate9198.6
vectara_avg_summary_length123.2145.8
vectara_factual_consistency8889.7
vectara_hallucination_rate1210.3
xstest9797.2
ZebraLogic95.173.7
τ²-Bench5765
τ²-Bench Telecom (AA run)73.464.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.