VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-4o vs GPT-4o mini

OpenAIvsOpenAI59 shared benchmarks552 head-to-head
BenchmarkGPT-4oGPT-4o mini
AA Agentic Index9.71
AA Intelligence11.27
AI2D94.275.2
AI2D (Acc)84.677.8
aider_polyglot30.73.6
AIR-Bench 202462.456.3
anthropic_red_team99.198.3
ARC-AGI-200
Artificial Analysis Coding Index24.211.4
bbq95.188.2
BLINK (Acc)6853.6
DROP83.479.7
Fortress47.248.1
gaia_level139.87.5
gaia_level2274.4
gaia_level314.30
gaia_overall28.94.7
gdpval00
GPQA Diamond70.142.6
GSM8K95.684.3
harmbench82.984.9
HLE5.34.2
humaneval90.687.2
IFBench3631
InfoVQA (Acc)80.757.9
LiveCodeBench38.335.5
livecodebench_easy82.581.7
livecodebench_hard4.54.3
livecodebench_medium32.125.2
LongVideoBench (val)66.758.2
MATH85.380.2
MathVista63.856.7
mgsm90.587
MLVU-MCQ (Acc)64.648.1
MMBench-EN-v1.1 (Acc)83.177.1
MMLongBench-DOC (Acc)42.829
mmlu88.181.8
MMMU72.259.4
MMMU (val) (Pass@1)69.152.1
MMMU-Pro59.941.5
MMStar (Acc)64.754.8
MMVet (Pass@1)69.166.9
MMVU-Val (Pass@1)67.461.6
narrativeqa80.476.8
naturalquestions_closedbook50.138.5
OCRBench (Acc)815785
OpenBookQA96.892
RealWorldQA (Acc)75.467.1
scicode33.422.9
ScreenSpot-V218.16.9
simple_safety_tests98.597.8
simplebench17.810.7
simpleqa39.49.9
SWE-bench Verified38.88.7
TOMATO37.728.8
Video-MME77.268.9
Video-MME (w/o sub.)71.964.8
WindowsAgentArena (Pass@1)9.42.7
xstest97.396

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.