VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 3.1 Pro vs Llama 3.1 Instruct 405B

GooglevsMeta25 shared benchmarks250 head-to-head
BenchmarkGemini 3.1 ProLlama 3.1 Instruct 405B
AA Agentic Index236.3
AA Intelligence47.78.5
AA-LCR7924.7
AA-Omniscience32.9-17.1
Artificial Analysis Coding Index68.814.5
Chinese SimpleQA (C-SimpleQA)85.954.7
Codeforces305225.3
critpt17.70
Fortress29.820.6
gdpval23.30
GPQA Diamond94.351.5
HLE51.44.2
IFBench77.139
LiveCodeBench91.730.1
mmlu92.688.6
MMLU-Pro9173.4
mmmlu92.673.8
OmniScience Accuracy55.323.2
OmniScience Non-Hallucination50.149
scicode5929.9
simplebench79.623
SWE-bench Pro54.211.2
SWE-bench Verified80.624.5
Terminal-Bench Hard68.56.8
τ²-Bench Telecom (AA run)99.319

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.