VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 3 Flash Preview vs GPT-5.4

GooglevsOpenAI47 shared benchmarks640 head-to-head
BenchmarkGemini 3 Flash PreviewGPT-5.4
AA Agentic Index49.758.2
AA Intelligence38.753.1
AA-LCR7377.7
AA-Omniscience10.15.8
aime_202696.799.2
apexAgents27.733.3
arc_agi_184.793.7
ARC-AGI-233.674
arena_elo14731477
arena_text_factuality14521476
arena_vision12601277
Artificial Analysis Coding Index42.671.1
charxiv_rq80.382.8
coding_arena_elo13871457
critpt8.623.4
frontiermath_tier_44.227.1
gdpval35.250.1
GDPval-AA (Elo)12041674
GPQA Diamond90.493
HLE43.543.7
hmmt_feb_202689.497.7
hmmt_nov_202593.395.8
IFBench7873.9
Legal Agent Benchmark00.4
livebench72.480.3
matharena_visual_math_overall85.892.5
MCP Atlas6270.6
MMMU-Pro81.281.2
OmniDocBench 1.512.189.1
OmniScience Accuracy53.450.9
OmniScience Non-Hallucination7.617.4
OSWorld-Verified65.175
scicode50.656.6
simpleqa_verified67.445.3
SWE-bench Multilingual72.771.7
SWE-bench Pro49.659.1
TauBench V3 - Banking20.839.6
Terminal-Bench 2.047.675.1
Terminal-Bench 2.15878.3
Terminal-Bench Hard38.657.6
toolathlon49.454.6
vectara_answer_rate99.899.9
vectara_avg_summary_length90.281.7
vectara_factual_consistency86.593
vectara_hallucination_rate13.57
τ²-Bench Telecom (AA run)80.487.1
τ³-Bench17.572.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.