VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.5 vs Gemini 3 Flash Preview

AnthropicvsGoogle46 shared benchmarks2519 head-to-head
BenchmarkClaude Opus 4.5Gemini 3 Flash Preview
AA Agentic Index59.649.7
AA Intelligence41.938.7
AA-LCR7673
AA-Omniscience1410.1
AIME 202592.899.7
aime_202695.196.7
arc_agi_18284.7
ARC-AGI-237.633.6
arena_elo14731473
arena_text_factuality14581452
Artificial Analysis Coding Index47.842.6
charxiv_rq68.580.3
coding_arena_elo14951387
critpt4.68.6
frontiermath_tier_44.24.2
gdpval47.335.2
GPQA Diamond8790.4
HLE30.843.5
hmmt_feb_202592.997.5
hmmt_feb_202685.389.4
hmmt_nov_202593.393.3
IFBench5878
livebench7672.4
MCP Atlas69.862
mmmlu90.891.8
MMMU-Pro7481.2
OmniDocBench 1.587.712.1
OmniScience Accuracy46.653.4
OmniScience Non-Hallucination397.6
OSWorld-Verified66.365.1
scicode5050.6
simplebench6261.1
simpleqa_verified41.867.4
swe_bench_bash76.875.8
SWE-bench Multilingual77.572.7
SWE-bench Pro57.149.6
SWE-bench Verified81.578
Terminal-Bench 2.059.347.6
Terminal-Bench Hard4738.6
toolathlon43.549.4
vectara_answer_rate98.799.8
vectara_avg_summary_length114.590.2
vectara_factual_consistency89.186.5
vectara_hallucination_rate10.913.5
VideoMMMU84.486.9
τ²-Bench Telecom (AA run)89.580.4

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.