VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs GPT-5

AnthropicvsOpenAI60 shared benchmarks1446 head-to-head
BenchmarkClaude Sonnet 4GPT-5
AA Agentic Index39.249.7
AA Intelligence29.835.3
AA-LCR69.776.3
AA-Omniscience0.2-8.7
aider_polyglot70.788
AIME33.17.6
AIME 20257495
AIR-Bench 202488.387.7
arc_agi_163.756.2
ARC-AGI-213.67.5
arena_vision12071212
ArtifactsBench57.373
Artificial Analysis Coding Index37.638.9
browsecomp12.254.9
browsecomp_zh29.165
critpt1.15.7
FinSearchComp-global4263.9
Fortress24.417
frontiermath_tier_4012.5
GAIA (text only)68.376.4
gdpval31.232.5
GPQA Diamond7887.3
harmbench9870
HLE10.728.5
HLE (with tools)20.335.2
HMMT 202515.993.3
IFBench5573.1
LiveCodeBench68.585
LiveCodeBench v648.587
mmlu_redux93.695.3
MMLU-Pro8487.5
MMMU74.484.2
MMMU-Pro62.478.4
Multi-SWE-Bench35.739.3
multichallenge57.171.1
MultiNRC18.452.1
OmniScience Accuracy22.740.3
OmniScience Non-Hallucination70.921
scicode4043
SEAL VISTA45.549.7
simplebench45.556.7
swe_bench_bash64.965
SWE-bench Multilingual56.955.3
SWE-bench Pro42.741.8
SWE-bench Verified80.274.9
Tau2 airline55.562.6
Tau2 retail7581.1
TauBench V3 - Banking16.722.1
Terminal-Bench36.443.8
Terminal-Bench 2.136.335.2
Terminal-Bench Hard31.137.9
vectara_answer_rate98.699.9
vectara_avg_summary_length145.8162.7
vectara_factual_consistency89.785.3
vectara_hallucination_rate10.314.7
VisualToolBench4.518.7
xbench_deepsearch64.677.8
τ²-Bench6585
τ²-Bench Telecom (AA run)64.686.5
τ³-Bench13.819.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.