VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5 vs o4-mini

OpenAIvsOpenAI42 shared benchmarks366 head-to-head
BenchmarkGPT-5o4-mini
AA Agentic Index49.736.1
AA Intelligence35.326.1
AA-LCR76.360
AA-Omniscience-8.7-35.7
aider_polyglot8872
AIME 20259592.7
AIR-Bench 202487.778.5
arc_agi_156.258.7
ARC-AGI-27.56.1
arena_vision12121201
Artificial Analysis Coding Index38.925.6
browsecomp54.951.5
critpt5.70.6
Fortress1721.5
frontiermath_tier_412.56.3
gdpval32.525.4
GPQA Diamond87.381.4
GSM8K-1.80
harmbench7097
HLE28.516.5
IFBench73.168.7
imo_202538.114.3
LiveCodeBench8584.5
MMMU84.281.6
MMMU-Pro78.469.2
multichallenge71.144.9
MultiNRC52.122.2
OmniScience Accuracy40.324.8
OmniScience Non-Hallucination2119.5
scicode4346.5
SEAL VISTA49.751.8
simplebench56.738.7
simpleqa_verified50.623.9
swe_bench_bash6545
SWE-bench Verified74.968.1
Terminal-Bench Hard37.915.2
vectara_answer_rate99.999.2
vectara_avg_summary_length162.7130.9
vectara_factual_consistency85.381.4
vectara_hallucination_rate14.718.6
VisualToolBench18.711.1
τ²-Bench Telecom (AA run)86.555.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.