VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.6 vs o4-mini

AnthropicvsOpenAI37 shared benchmarks343 head-to-head
BenchmarkClaude Opus 4.6o4-mini
AA Agentic Index67.636.1
AA Intelligence44.926.1
AA-LCR74.360
AA-Omniscience13.7-35.7
AIME 202599.892.7
arc_agi_19358.7
ARC-AGI-268.86.1
arena_vision13001201
Artificial Analysis Coding Index48.125.6
browsecomp86.851.5
critpt12.60.6
Fortress20.521.5
frontiermath_tier_422.96.3
gdpval55.925.4
GPQA Diamond91.381.4
GSM8K0.60
HLE53.116.5
IFBench62.568.7
LiveCodeBench88.884.5
MMMU-Pro77.369.2
multichallenge5644.9
MultiNRC57.122.2
OmniScience Accuracy4724.8
OmniScience Non-Hallucination37.219.5
scicode5246.5
SEAL VISTA46.151.8
simplebench67.638.7
simpleqa_verified46.523.9
swe_bench_bash75.645
SWE-bench Verified80.868.1
Terminal-Bench Hard65.415.2
vectara_answer_rate99.899.2
vectara_avg_summary_length137.6130.9
vectara_factual_consistency87.881.4
vectara_hallucination_rate12.218.6
VisualToolBench27.511.1
τ²-Bench Telecom (AA run)99.355.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.