VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs Gemini 2.5 Pro

AnthropicvsGoogle57 shared benchmarks3620 head-to-head
BenchmarkClaude Sonnet 4.5Gemini 2.5 Pro
AA Agentic Index50.67.2
AA Intelligence37.427
AA-LCR68.366
AA-Omniscience-0.1-14.3
AIME 20258888.3
AIR-Bench 202489.873.6
arc_agi_163.741
ARC-AGI-213.64.9
arena_elo14561446
arena_text_factuality14481462
ArtifactsBench61.557.7
Artificial Analysis Coding Index52.146.7
browsecomp24.19.9
browsecomp_zh42.432.2
coding_arena_elo13921224
critpt1.12.6
FinSearchComp-global60.842.6
Fortress1754.9
frontiermath_tier_44.24.2
GAIA (text only)71.260.2
gdpval40.48.5
GPQA Diamond83.484.4
HLE19.822.5
HLE (with tools)3228.4
HMMT 202574.665.7
hmmt_feb_202579.282.5
hmmt_nov_202581.780
IFBench57.349
LiveCodeBench7182.7
matharena_visual_math_overall75.877.2
MathVista79.883.9
MMLU-Pro88.286
MMMU79.683.9
MMMU-Pro68.774.9
mrcr55.493
multichallenge55.353.6
OmniScience Accuracy32.939
OmniScience Non-Hallucination50.912.6
scicode4543
SEAL VISTA48.850.8
simplebench54.362.4
simpleqa_verified23.656
swe_bench_bash71.453.6
SWE-bench Verified8267.2
TauBench V3 - Banking24.59.7
Terminal-Bench5125.3
Terminal-Bench 2.155.828.5
Terminal-Bench Hard35.626.5
theagentcompany4139.3
vectara_answer_rate95.699.1
vectara_avg_summary_length127.8106.4
vectara_factual_consistency8893
vectara_hallucination_rate127
xbench_deepsearch6656
τ²-Bench9854
τ²-Bench Telecom (AA run)78.154.1
τ³-Bench199.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.