VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs Gemma 4 31B

AnthropicvsGoogle53 shared benchmarks2923 head-to-head
BenchmarkClaude Sonnet 4.5Gemma 4 31B
AA Agentic Index50.614.4
AA Intelligence37.429.7
AA-LCR68.368.3
AA-Omniscience-0.1-47.9
AI2D8789
arena_elo14561451
arena_text_factuality14481449
Artificial Analysis Coding Index52.143.4
CC-OCR68.175.7
charxiv_rq67.267.9
coding_arena_elo13921364
critpt1.11.4
gdpval40.415.5
GPQA (unspecified)83.484.3
GPQA Diamond83.485.7
HallusionBench59.967.4
HLE19.826.5
HLE (with tools)3226.5
hmmt_feb_202579.288.7
hmmt_nov_202581.787.5
IFBench57.375.6
imo_answer_bench65.974.5
LiveCodeBench v66480
MathVista79.879.3
MCP Atlas59.557.2
MMBench EN-DEV-v1.188.390.9
mmlu_redux95.693.7
MMLU-Pro88.285.2
mmmlu89.188.4
MMMU79.680.4
MMMU-Pro68.776.9
OmniDocBench 1.585.880.1
OmniScience Accuracy32.920
OmniScience Non-Hallucination50.918.1
RealWorldQA70.372.3
scicode4543.4
simpleqa_verified23.69.6
SimpleVQA57.652.9
SWE-bench Multilingual6851.7
SWE-bench Pro43.635.7
SWE-bench Verified8252
TauBench V3 - Banking24.514.8
Terminal-Bench 2.05042.9
Terminal-Bench 2.155.843.4
Terminal-Bench Hard35.636.4
vectara_answer_rate95.6100
vectara_avg_summary_length127.875.8
vectara_factual_consistency8892.6
vectara_hallucination_rate127.4
ZEROBench_sub26.326
τ²-Bench9876.9
τ²-Bench Telecom (AA run)78.165.5
τ³-Bench1967.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.