VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemma 4 26B A4B vs GPT-5.1

GooglevsOpenAI36 shared benchmarks234 head-to-head
BenchmarkGemma 4 26B A4BGPT-5.1
AA Agentic Index32.132.2
AA Intelligence26.137.5
AA-LCR61.776.7
AA-Omniscience-50.85.4
AIME 20259094.2
arena_elo14381439
arena_text_factuality14451445
arena_vision12381250
Artificial Analysis Coding Index39.349.4
browsecomp26.350.8
coding_arena_elo13611421
critpt04.9
gdpval25.725
GPQA Diamond82.388.1
HLE19.328.5
HLE (with tools)17.242.7
hmmt_feb_202591.796.3
hmmt_nov_202587.591.7
IFBench72.472.9
LiveCodeBench v677.187
MCP Atlas5050.1
MMLU-Pro85.287
mmmlu86.391
MMMU78.485.4
MMMU-Pro73.875.5
OmniScience Accuracy19.137.7
OmniScience Non-Hallucination13.648.1
scicode40.343.3
SWE-bench Verified57.476.3
TauBench V3 - Banking1215.9
Terminal-Bench 2.034.247.6
Terminal-Bench 2.13952.4
Terminal-Bench Hard2545.5
τ²-Bench68.282.7
τ²-Bench Telecom (AA run)43.681.9
τ³-Bench5914

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.