VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-4o vs GPT-5

OpenAIvsOpenAI52 shared benchmarks646 head-to-head
BenchmarkGPT-4oGPT-5
AA Agentic Index9.749.7
AA Intelligence11.235.3
AA-LCR5576.3
AA-Omniscience-10.5-8.7
aider_polyglot30.788
AIME 202511.795
AIR-Bench 202462.487.7
arc_agi_14.556.2
ARC-AGI-207.5
arena_vision11621212
Artificial Analysis Coding Index24.238.9
critpt05.7
ERQA35.265.7
Fortress47.217
gaia_level139.878.5
gaia_level22764.8
gaia_level314.346.9
gaia_overall28.966.1
gdpval032.5
GPQA Diamond70.187.3
GSM8K95.6-1.8
harmbench82.970
HLE5.328.5
humaneval90.693.4
IFBench3673.1
LiveCodeBench38.385
LiveCodeBench v630.987
metr_hcast2568.4
metr_re_bench040
metr_swaa99.2100
mmlu_redux8895.3
MMLU-Pro74.787.5
MMMU72.284.2
MMMU-Pro59.978.4
multichallenge40.371.1
MultiNRC12.452.1
OmniScience Accuracy23.740.3
OmniScience Non-Hallucination62.121
scicode33.443
SEAL VISTA34.949.7
simplebench17.856.7
swe_bench_bash21.665
SWE-bench Verified38.874.9
Tau2 airline45.562.6
Tau2 retail63.481.1
Terminal-Bench Hard8.337.9
vectara_answer_rate93.899.9
vectara_avg_summary_length86.6162.7
vectara_factual_consistency90.485.3
vectara_hallucination_rate9.614.7
VideoMMMU61.284.6
τ²-Bench Telecom (AA run)28.986.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.