VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs Gemini 2.5 Flash

AnthropicvsGoogle45 shared benchmarks2421 head-to-head
BenchmarkClaude Sonnet 4Gemini 2.5 Flash
AA Agentic Index39.218.8
AA Intelligence29.817.7
AA-LCR69.765.7
AA-Omniscience0.2-29.8
aider_polyglot70.761.9
AIME33.156.3
AIME 202443.482.3
AIME 20257472
AIR-Bench 202488.368.7
anthropic_red_team99.298.8
arc_agi_163.733.3
ARC-AGI-213.62.5
arena_vision12071214
Artificial Analysis Coding Index37.622.2
bbq97.997.7
critpt1.11.4
frontiermath_tier_404.2
gdpval31.211.9
GPQA Diamond7882.8
harmbench9862.6
HLE10.712.1
IFBench5550.3
LiveCodeBench68.576.2
livecodebench_easy98.899.1
livecodebench_hard32.648.3
livecodebench_medium7682.5
MMMU74.479.7
MMMU-Pro62.469.1
OmniScience Accuracy22.726.1
OmniScience Non-Hallucination70.924.7
scicode4035.9
SEAL VISTA45.549.1
simple_safety_tests10098
simplebench45.541.2
simpleqa15.926.9
swe_bench_bash64.928.7
SWE-bench Verified80.260.4
Terminal-Bench Hard31.113.6
vectara_answer_rate98.699
vectara_avg_summary_length145.8101.5
vectara_factual_consistency89.792.2
vectara_hallucination_rate10.37.8
VisualToolBench4.54.7
xstest97.298.8
τ²-Bench Telecom (AA run)64.631.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.