VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 3.1 Pro vs Gemini 3 Flash Preview

GooglevsGoogle54 shared benchmarks475 head-to-head
BenchmarkGemini 3.1 ProGemini 3 Flash Preview
AA Agentic Index2349.7
AA Intelligence47.738.7
AA-LCR7973
AA-Omniscience32.910.1
aime_202698.396.7
apexAgents33.527.7
arc_agi_19884.7
ARC-AGI-277.133.6
arena_elo14861473
arena_text_factuality14711452
arena_vision12801260
Artificial Analysis Coding Index68.842.6
Blueprint-Bench 226.50
charxiv_rq89.980.3
coding_arena_elo14471387
critpt17.78.6
Finance Agent v24342.6
frontiermath_tier_416.74.2
gdpval23.335.2
GDPval-AA (Elo)13171204
GPQA Diamond94.390.4
HLE51.443.5
hmmt_feb_202694.789.4
hmmt_nov_202594.893.3
Humanity’s Last Exam44.433.7
IFBench77.178
Legal Agent Benchmark00
livebench79.972.4
matharena_visual_math_overall89.485.8
MCP Atlas78.262
mmmlu92.691.8
MMMU-Pro8381.2
mrcr_v2_8needle_128k_average84.967.2
mrcr_v2_8needle_1m_pointwise26.326.3
OmniScience Accuracy55.353.4
OmniScience Non-Hallucination50.17.6
OSWorld-Verified76.265.1
scicode5950.6
simplebench79.661.1
simpleqa_verified77.367.4
SWE-bench Multilingual76.972.7
SWE-bench Pro54.249.6
SWE-bench Verified80.678
TauBench V3 - Banking21.420.8
Terminal-Bench 2.068.547.6
Terminal-Bench 2.17458
Terminal-Bench Hard68.538.6
toolathlon48.849.4
vectara_answer_rate99.499.8
vectara_avg_summary_length107.790.2
vectara_factual_consistency89.686.5
vectara_hallucination_rate10.413.5
τ²-Bench Telecom (AA run)99.380.4
τ³-Bench67.117.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.