VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.6 vs Gemini 3 Flash Preview

AnthropicvsGoogle53 shared benchmarks439 head-to-head
BenchmarkClaude Opus 4.6Gemini 3 Flash Preview
AA Agentic Index67.649.7
AA Intelligence44.938.7
AA-LCR74.373
AA-Omniscience13.710.1
AIME 202599.899.7
aime_202696.796.7
apexAgents3327.7
arc_agi_19384.7
ARC-AGI-268.833.6
arena_elo14971473
arena_text_factuality14871452
arena_vision13001260
Artificial Analysis Coding Index48.142.6
charxiv_rq69.180.3
coding_arena_elo15451387
critpt12.68.6
frontiermath_tier_422.94.2
gdpval55.935.2
GDPval-AA (Elo)16191204
GPQA Diamond91.390.4
HLE53.143.5
hmmt_feb_202696.289.4
hmmt_nov_202596.393.3
IFBench62.578
Legal Agent Benchmark4.20
livebench76.372.4
matharena_visual_math_overall72.385.8
MCP Atlas76.862
mmmlu91.191.8
MMMU-Pro77.381.2
mrcr_v2_8needle_128k_average8467.2
OmniDocBench 1.586.612.1
OmniScience Accuracy4753.4
OmniScience Non-Hallucination37.27.6
OSWorld-Verified72.765.1
scicode5250.6
screenspot_pro_no_tools57.769.1
simplebench67.661.1
simpleqa_verified46.567.4
swe_bench_bash75.675.8
SWE-bench Multilingual77.872.7
SWE-bench Pro57.349.6
SWE-bench Verified80.878
Terminal-Bench 2.065.447.6
Terminal-Bench Hard65.438.6
toolathlon56.849.4
vectara_answer_rate99.899.8
vectara_avg_summary_length137.690.2
vectara_factual_consistency87.886.5
vectara_hallucination_rate12.213.5
Vending-Bench 2801759363500
τ²-Bench Telecom (AA run)99.380.4
τ³-Bench72.417.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.