VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs Gemini 3.1 Pro

AnthropicvsGoogle52 shared benchmarks646 head-to-head
BenchmarkClaude Sonnet 4.5Gemini 3.1 Pro
AA Agentic Index50.623
AA Intelligence37.447.7
AA-LCR68.379
AA-Omniscience-0.132.9
arc_agi_163.798
ARC-AGI-213.677.1
arena_elo14561486
arena_text_factuality14481471
Artificial Analysis Coding Index52.168.8
browsecomp24.185.9
charxiv_rq67.289.9
coding_arena_elo13921447
critpt1.117.7
Fortress1729.8
frontiermath_tier_44.216.7
gdpval40.423.3
GPQA Diamond83.494.3
HLE19.851.4
HLE (with tools)3251.6
hmmt_nov_202581.794.8
IFBench57.377.1
imo_answer_bench65.991
LiveCodeBench7191.7
LiveCodeBench v66491.7
matharena_visual_math_overall75.889.4
MCP Atlas59.578.2
MMLU-Pro88.291
mmmlu89.192.6
MMMU-Pro68.783
multichallenge55.371.4
MultiNRC35.864.7
OmniScience Accuracy32.955.3
OmniScience Non-Hallucination50.950.1
OSWorld-Verified61.476.2
scicode4559
simplebench54.379.6
simpleqa_verified23.677.3
SWE-bench Multilingual6876.9
SWE-bench Pro43.654.2
SWE-bench Verified8280.6
TauBench V3 - Banking24.521.4
Terminal-Bench 2.05068.5
Terminal-Bench 2.155.874
Terminal-Bench Hard35.668.5
toolathlon4148.8
vectara_answer_rate95.699.4
vectara_avg_summary_length127.8107.7
vectara_factual_consistency8889.6
vectara_hallucination_rate1210.4
VisualToolBench6.229
τ²-Bench Telecom (AA run)78.199.3
τ³-Bench1967.1

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.