VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 2.5 Pro vs o4-mini

GooglevsOpenAI49 shared benchmarks2622 head-to-head
BenchmarkGemini 2.5 Proo4-mini
AA Agentic Index7.236.1
AA Intelligence2726.1
AA-LCR6660
AA-Omniscience-14.3-35.7
aider_polyglot82.272
AIME 202588.392.7
AIR-Bench 202473.678.5
anthropic_red_team99.598.2
arc_agi_14158.7
ARC-AGI-24.96.1
arena_vision12461201
Artificial Analysis Coding Index46.725.6
bbq96.494
browsecomp9.951.5
critpt2.60.6
Fortress54.921.5
frontiermath_tier_44.26.3
gdpval8.525.4
GPQA Diamond84.481.4
harmbench65.497
HLE22.516.5
IFBench4968.7
imo_202531.614.3
LiveCodeBench82.784.5
livecodebench_easy98.898.8
livecodebench_hard59.462.9
livecodebench_medium90.692.2
MathVista83.984.3
MMMU83.981.6
MMMU-Pro74.969.2
multichallenge53.644.9
OmniScience Accuracy3924.8
OmniScience Non-Hallucination12.619.5
PropensityBench7915.8
scicode4346.5
SEAL VISTA50.851.8
simple_safety_tests97100
simplebench62.438.7
simpleqa_verified5623.9
swe_bench_bash53.645
SWE-bench Verified67.268.1
Terminal-Bench Hard26.515.2
usamo_202524.419.1
vectara_answer_rate99.199.2
vectara_avg_summary_length106.4130.9
vectara_factual_consistency9381.4
vectara_hallucination_rate718.6
xstest98.797.4
τ²-Bench Telecom (AA run)54.155.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.