VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.6 vs GPT-5

AnthropicvsOpenAI37 shared benchmarks288 head-to-head
BenchmarkClaude Sonnet 4.6GPT-5
AA Agentic Index61.649.7
AA Intelligence48.435.3
AA-LCR7476.3
AA-Omniscience12.2-8.7
arc_agi_186.556.2
ARC-AGI-260.47.5
arena_vision12781212
Artificial Analysis Coding Index6338.9
browsecomp76.254.9
coding_arena_elo15231419
critpt3.15.7
frontiermath_tier_48.312.5
gdpval54.832.5
GPQA (unspecified)89.985.7
GPQA Diamond89.987.3
harmbench24.270
HLE4928.5
HLE (with tools)46.835.2
IFBench56.673.1
MMMU-Pro75.678.4
OmniScience Accuracy40.940.3
OmniScience Non-Hallucination51.621
scicode4743
simpleqa_verified2950.6
SWE-bench Pro58.141.8
SWE-bench Verified79.674.9
Tau2 retail91.781.1
TauBench V3 - Banking34.422.1
Terminal-Bench 2.059.135.2
Terminal-Bench 2.171.235.2
Terminal-Bench Hard59.137.9
vectara_answer_rate99.999.9
vectara_avg_summary_length114.7162.7
vectara_factual_consistency89.485.3
vectara_hallucination_rate10.614.7
τ²-Bench Telecom (AA run)97.986.5
τ³-Bench30.519.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.