VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs Gemini 2.5 Pro

AnthropicvsGoogle59 shared benchmarks2731 head-to-head
BenchmarkClaude Sonnet 4Gemini 2.5 Pro
AA Agentic Index39.27.2
AA Intelligence29.827
AA-LCR69.766
AA-Omniscience0.2-14.3
aider_polyglot70.782.2
AIME 20257488.3
AIR-Bench 202488.373.6
anthropic_red_team99.299.5
arc_agi_163.741
ARC-AGI-213.64.9
arena_vision12071246
ArtifactsBench57.357.7
Artificial Analysis Coding Index37.646.7
bbq97.996.4
browsecomp12.29.9
browsecomp_zh29.132.2
critpt1.12.6
FinSearchComp-global4242.6
Fortress24.454.9
frontiermath_tier_404.2
GAIA (text only)68.360.2
gdpval31.28.5
GPQA Diamond7884.4
harmbench9865.4
HLE10.722.5
HLE (with tools)20.328.4
HMMT 202515.965.7
IFBench5549
LiveCodeBench68.582.7
livecodebench_easy98.898.8
livecodebench_hard32.659.4
livecodebench_medium7690.6
MMLU-Pro8486
MMMU74.483.9
MMMU-Pro62.474.9
multichallenge57.153.6
OmniScience Accuracy22.739
OmniScience Non-Hallucination70.912.6
scicode4043
SEAL VISTA45.550.8
simple_safety_tests10097
simplebench45.562.4
simpleqa15.950.8
swe_bench_bash64.953.6
SWE-bench Verified80.267.2
TauBench V3 - Banking16.79.7
Terminal-Bench36.425.3
Terminal-Bench 2.136.328.5
Terminal-Bench Hard31.126.5
theagentcompany3739.3
vectara_answer_rate98.699.1
vectara_avg_summary_length145.8106.4
vectara_factual_consistency89.793
vectara_hallucination_rate10.37
xbench_deepsearch64.656
xstest97.298.7
τ²-Bench6554
τ²-Bench Telecom (AA run)64.654.1
τ³-Bench13.89.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.