VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.6 vs GPT-5

AnthropicvsOpenAI55 shared benchmarks4213 head-to-head
BenchmarkClaude Opus 4.6GPT-5
AA Agentic Index67.649.7
AA Intelligence44.935.3
AA-LCR74.376.3
AA-Omniscience13.7-8.7
AIME 202599.895
AIME25 no tools95.694.6
arc_agi_19356.2
ARC-AGI-268.87.5
arena_vision13001212
Artificial Analysis Coding Index48.138.9
browsecomp86.854.9
coding_arena_elo15451419
critpt12.65.7
ERQA40.865.7
Fortress20.517
frontiermath_tier_422.912.5
gdpval55.932.5
GPQA Diamond91.387.3
GSM8K0.6-1.8
HLE53.128.5
HLE (with tools)62.735.2
hmmt_nov_202596.389.2
IFBench62.573.1
imo_answer_bench75.376
LiveCodeBench88.885
LiveCodeBench v688.887
matharena_visual_math_overall72.378.8
metr_hcast7768.4
metr_re_bench97.440
metr_swaa98.5100
MMLU-Pro89.187.5
MMMU-Pro77.378.4
multichallenge5671.1
MultiNRC57.152.1
ocrbench_v248.455.5
OmniScience Accuracy4740.3
OmniScience Non-Hallucination37.221
scicode5243
SEAL VISTA46.149.7
simplebench67.656.7
simpleqa_verified46.550.6
swe_bench_bash75.665
SWE-bench Multilingual77.855.3
SWE-bench Pro57.341.8
SWE-bench Verified80.874.9
Tau2 retail91.981.1
Terminal-Bench 2.065.435.2
Terminal-Bench Hard65.437.9
vectara_answer_rate99.899.9
vectara_avg_summary_length137.6162.7
vectara_factual_consistency87.885.3
vectara_hallucination_rate12.214.7
VisualToolBench27.518.7
τ²-Bench Telecom (AA run)99.386.5
τ³-Bench72.419.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.