VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs Gemini 3.5 Flash

AnthropicvsGoogle34 shared benchmarks133 head-to-head
BenchmarkClaude Sonnet 4.5Gemini 3.5 Flash
AA Agentic Index50.670.4
AA Intelligence37.452
AA-LCR68.381
AA-Omniscience-0.121.2
arc_agi_163.792.5
ARC-AGI-213.672.1
arena_elo14561477
arena_text_factuality14481466
Artificial Analysis Coding Index52.170.1
charxiv_rq67.284.2
coding_arena_elo13921490
critpt1.113.1
frontiermath_tier_44.214.6
gdpval40.457.8
GPQA Diamond83.492.2
HLE19.842.7
IFBench57.376.3
matharena_visual_math_overall75.889.9
MCP Atlas59.583.6
MMMU-Pro68.784.3
OmniScience Accuracy32.951.4
OmniScience Non-Hallucination50.938.2
OSWorld-Verified61.478.4
scicode4553.1
simplebench54.376.7
simpleqa_verified23.668.4
SWE-bench Pro43.655.1
TauBench V3 - Banking24.532.2
Terminal-Bench 2.05076.2
Terminal-Bench 2.155.878.7
Terminal-Bench Hard35.646.2
toolathlon4156.5
τ²-Bench Telecom (AA run)78.195.6
τ³-Bench1925.4

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.