VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs Gemini 3 Pro

AnthropicvsGoogle77 shared benchmarks1660 head-to-head
BenchmarkClaude Sonnet 4.5Gemini 3 Pro
AA Agentic Index50.652
AA Intelligence37.440.6
AA-LCR68.373
AA-Omniscience-0.115.3
AIME 202588100
AIME25 no tools8896
arc_agi_163.775
ARC-AGI-213.654
ARC-AGI-2 (Verified)13.631.1
arena_elo14561485
arena_text_factuality14481481
Arena-Hard (Creative Writing)76.793.6
Arena-Hard (Hard Prompt)63.372.6
Artificial Analysis Coding Index52.146.5
browsecomp24.159.2
BrowseComp (context management)26.167.6
browsecomp_zh42.466.8
charxiv_rq67.281.4
coding_arena_elo13921438
critpt1.19.1
Fortress1741.7
frontiermath_tier_44.218.8
gdpval40.434.2
GPQA Diamond83.491.9
HLE19.845.8
HLE (with tools)3245.8
hmmt_feb_202579.297.5
hmmt_nov_202581.793.3
IFBench57.370.4
imo_answer_bench65.983.3
LiveCodeBench7192
LiveCodeBench v66490.7
longbench_v261.868.2
matharena_visual_math_overall75.884.2
MathVista79.889.8
MCP Atlas59.570.3
MMLU-Pro88.290.1
mmmlu89.191.8
MMMU-Pro68.781
mrcr55.489.7
Multi-SWE-Bench44.342.7
multichallenge55.365.7
MultiNRC35.859
OctoCodingbench22.822.9
OJ-Bench (cpp)30.468.5
OmniDocBench 1.585.888.5
OmniScience Accuracy32.955.8
OmniScience Non-Hallucination50.910
scicode4556.1
SEAL VISTA48.851.5
Seal-053.445.5
simplebench54.376.4
simpleqa_verified23.672.9
SimpleVQA57.669.7
swe_bench_bash71.474.2
SWE-bench Multilingual6868.7
SWE-bench Pro43.643.3
SWE-bench Verified8278
SWE-Perf36.5
SWT-bench69.579.7
Terminal-Bench 2.05054.2
Terminal-Bench Hard35.656.9
toolathlon4136.4
vectara_answer_rate95.699.4
vectara_avg_summary_length127.8101.9
vectara_factual_consistency8886.4
vectara_hallucination_rate1213.6
VIBE (Average)85.282.4
VIBE-Android87.578.7
VIBE-Backend90.878.7
VIBE-iOS81.275.8
VIBE-Simulation79.189.2
VIBE-Web87.389.5
VisualToolBench6.226.9
τ²-Bench9898
τ²-Bench (Retail)86.285.3
τ²-Bench Telecom (AA run)78.198

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.