VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 5 vs Gemini 3.1 Pro

AnthropicvsGoogle45 shared benchmarks2718 head-to-head
BenchmarkClaude Sonnet 5Gemini 3.1 Pro
AA Agentic Index49.723
AA Intelligence55.347.7
AA-LCR7779
AA-Omniscience16.432.9
arena_elo14631486
arena_text_factuality14531471
Artificial Analysis Coding Index71.568.8
browsecomp84.785.9
charxiv_reasoning_with_tools88.383.2
charxiv_rq7789.9
coding_arena_elo15401447
critpt16.917.7
DeepSWE 1.15412
gdpval54.823.3
GDPval-AA v21618962
GDPVal-AA v2 (Elo)1598965
GPQA Diamond91.194.3
HLE57.451.4
Legal Agent Benchmark5.80
livebench_agentic_coding59.444.1
livebench_coding80.776.5
livebench_data_analysis71.778.5
livebench_instruction_following63.979.1
livebench_language7585.4
livebench_math92.991
livebench_reasoning88.784
MLE-Bench66.942.6
MMMU-Pro77.383
mrcr_v2_8needle_128k_average81.584.9
officeqa_pro59.442.9
OmniScience Accuracy4055.3
OmniScience Non-Hallucination60.650.1
OSWorld-Verified81.276.2
scicode53.659
simplebench60.679.6
simpleqa_verified2577.3
SWE-bench Multilingual78.376.9
SWE-bench Pro63.254.2
SWE-bench Verified85.280.6
TauBench V3 - Banking37.321.4
Terminal-Bench 2.080.468.5
Terminal-Bench 2.180.574
toolathlon54.348.8
usamo_202679.574.4
τ³-Bench28.267.1

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.