VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 2.5 Flash vs Llama 3.1 Instruct 405B

GooglevsMeta27 shared benchmarks234 head-to-head
BenchmarkGemini 2.5 FlashLlama 3.1 Instruct 405B
AA Agentic Index18.86.3
AA Intelligence17.78.5
AA-LCR65.724.7
AA-Omniscience-29.8-17.1
aider_polyglot61.95.8
AIME 202482.323.3
AIR-Bench 202468.758.6
anthropic_red_team98.896.5
Artificial Analysis Coding Index22.214.5
bbq97.794.5
critpt1.40
gdpval11.90
GPQA Diamond82.851.5
harmbench62.662.7
HLE12.14.2
IFBench50.339
LiveCodeBench76.230.1
OmniScience Accuracy26.123.2
OmniScience Non-Hallucination24.749
scicode35.929.9
simple_safety_tests9898.8
simplebench41.223
simpleqa26.923.2
SWE-bench Verified60.424.5
Terminal-Bench Hard13.66.8
xstest98.895.9
τ²-Bench Telecom (AA run)31.619

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.