VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemma 4 31B vs Qwen3.5 397B A17B

GooglevsAlibaba59 shared benchmarks950 head-to-head
BenchmarkGemma 4 31BQwen3.5 397B A17B
AA Agentic Index14.453.3
AA Intelligence29.734.3
AA-LCR68.372.7
AA-Omniscience-47.9-30.8
aime_202689.294.2
arena_elo14511442
arena_text_factuality14491445
arena_vision12521249
Artificial Analysis Coding Index43.448.2
C-Eval82.693
CC-OCR75.782
charxiv_rq67.980.8
Claw Eval (pass@3)2548.1
Claw-Eval Avg48.570.7
coding_arena_elo13641399
critpt1.41.7
DeepPlanning2434.3
DynaMath79.586.3
ERQA57.567.5
gdpval15.535.8
GPQA Diamond85.789.3
HLE26.529
HLE (with tools)26.548.3
hmmt_feb_202588.794.8
hmmt_feb_202677.287.9
hmmt_nov_202587.592.7
IFBench75.678.8
imo_answer_bench74.580.9
itbenchSre37.334.1
LiveCodeBench v68083.6
mcpmark18.146.1
mmlu_redux93.794.9
MMLU-Pro85.287.8
mmmlu88.488.5
MMMU80.485
MMMU-Pro76.979
MMStar77.383.8
nl2repo15.532.2
OmniScience Accuracy2030.8
OmniScience Non-Hallucination18.117.3
QwenClawBench41.751.8
QwenWebBench11971186
RealWorldQA72.383.9
scicode43.442
simpleqa_verified9.626
SimpleVQA52.967.1
SkillsBench Avg523.630
supergpqa65.770.4
SWE-bench Multilingual51.769.3
SWE-bench Pro35.750.9
SWE-bench Verified5276.4
TauBench V3 - Banking14.813.4
Terminal-Bench 2.042.952.5
Terminal-Bench 2.143.451.3
Terminal-Bench Hard36.440.9
VITA-Bench4349.7
WideSearch35.274
τ²-Bench Telecom (AA run)65.595.6
τ³-Bench67.513.4

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.