VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.5 vs Gemma 4 31B

AnthropicvsGoogle61 shared benchmarks538 head-to-head
BenchmarkClaude Opus 4.5Gemma 4 31B
AA Agentic Index59.614.4
AA Intelligence41.929.7
AA-LCR7668.3
AA-Omniscience14-47.9
aime_202695.189.2
arena_elo14731451
arena_text_factuality14581449
Artificial Analysis Coding Index47.843.4
C-Eval92.282.6
CC-OCR76.975.7
charxiv_rq68.567.9
Claw Eval (pass@3)59.625
Claw-Eval Avg76.648.5
coding_arena_elo14951364
critpt4.61.4
DynaMath79.779.5
ERQA46.857.5
gdpval47.315.5
GPQA Diamond8785.7
HLE30.826.5
HLE (with tools)43.426.5
hmmt_feb_202592.988.7
hmmt_feb_202685.377.2
hmmt_nov_202593.387.5
IFBench5875.6
imo_answer_bench8474.5
LiveCodeBench v684.880
mathvision77.185.6
MathVista80.279.3
MCP Atlas69.857.2
mmlu_redux95.693.7
MMLU-Pro9085.2
mmmlu90.888.4
MMMU80.780.4
MMMU-Pro7476.9
MMStar73.277.3
nl2repo43.215.5
OCRBench86.586.1
OmniDocBench 1.587.780.1
OmniScience Accuracy46.620
OmniScience Non-Hallucination3918.1
QwenClawBench52.341.7
QwenWebBench15361197
RealWorldQA7772.3
scicode5043.4
simpleqa_verified41.89.6
SimpleVQA69.752.9
SkillsBench Avg545.323.6
supergpqa70.665.7
SWE-bench Multilingual77.551.7
SWE-bench Pro57.135.7
SWE-bench Verified81.552
Terminal-Bench 2.059.342.9
Terminal-Bench Hard4736.4
tool_decathlon43.521.2
vectara_answer_rate98.7100
vectara_avg_summary_length114.575.8
vectara_factual_consistency89.192.6
vectara_hallucination_rate10.97.4
τ²-Bench98.276.9
τ²-Bench Telecom (AA run)89.565.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.