VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 3 Pro vs GPT-5.4

GooglevsOpenAI54 shared benchmarks1242 head-to-head
BenchmarkGemini 3 ProGPT-5.4
AA Agentic Index5258.2
AA Intelligence40.653.1
AA-LCR7377.7
AA-Omniscience15.35.8
aime_202691.799.2
apexAgents18.433.3
arc_agi_17593.7
ARC-AGI-25474
arena_elo14851477
arena_text_factuality14811476
arena_vision12901277
Artificial Analysis Coding Index46.571.1
browsecomp59.282.7
browsecomp_with_context_manager59.282.7
charxiv_rq81.482.8
coding_arena_elo14381457
critpt9.123.4
cybergym39.966.3
deepsearchqa_f163.278.6
frontiermath_tier_418.827.1
gdpval34.250.1
GDPval-AA (Elo)11951674
GPQA Diamond91.993
HLE45.843.7
HLE (with tools)45.852.1
hmmt_feb_202686.497.7
hmmt_nov_202593.395.8
IFBench70.473.9
imo_answer_bench83.391.4
livebench73.480.3
matharena_visual_math_overall84.292.5
mathvision86.192
MCP Atlas70.370.6
MMLU-Pro90.187.5
MMMU-Pro8181.2
MultiNRC5958.3
OmniDocBench 1.588.589.1
OmniScience Accuracy55.850.9
OmniScience Non-Hallucination1017.4
scicode56.156.6
SEAL VISTA51.550.9
simpleqa_verified72.945.3
SWE-bench Multilingual68.771.7
SWE-bench Pro43.359.1
Terminal-Bench 2.054.275.1
Terminal-Bench Hard56.957.6
tool_decathlon36.454.6
toolathlon36.454.6
vectara_answer_rate99.499.9
vectara_avg_summary_length101.981.7
vectara_factual_consistency86.493
vectara_hallucination_rate13.67
VisualToolBench26.929.2
τ²-Bench Telecom (AA run)9887.1

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.