VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 3.1 Pro vs Kimi K2.5

GooglevsMoonshot79 shared benchmarks6811 head-to-head
BenchmarkGemini 3.1 ProKimi K2.5
AA Agentic Index2352.8
AA Intelligence47.736
AA-LCR7973
AA-Omniscience32.9-7.3
aime_202698.395.8
apexAgents33.511.5
arc_agi_19865.3
ARC-AGI-277.111.8
arena_elo14861450
arena_text_factuality14711445
arena_vision12801247
Artificial Analysis Coding Index68.846.8
baby_vision51.636.5
baby_vision_with_python68.340.5
browsecomp85.974.9
BrowseComp (Agent Swarm)85.978.4
BrowseComp (w/ Ctx)85.974.9
browsecomp_with_context_manager85.974.9
charxiv_rq89.978.7
charxiv_rq_with_python89.978.7
coding_arena_elo14471436
critpt17.73.1
cybergym38.841.3
deepsearchqa_accuracy60.277.1
deepsearchqa_f181.989
Fortress29.841.1
FORTRESS (Adversarial)65.254.1
FORTRESS (Benign)9898.3
frontiermath_tier_416.74.2
gdpval23.338.3
GDPval-AA v29621009
Global-MMLU-Lite92.784
GPQA Diamond94.387.9
HLE51.450.2
HLE (with tools)51.651.8
hmmt_feb_202694.787.1
hmmt_nov_202594.891.1
IFBench77.170.2
imo_answer_bench9181.8
livebench79.969.1
LiveCodeBench v691.785
matharena_visual_math_overall89.480.6
mathvision89.884.2
mathvision_with_python95.785
MCP Atlas78.264
mcpmark55.929.5
MMLU-Pro9187.1
mmmu_pro_with_python85.377.7
MMMU-Pro8378.5
multichallenge71.461.4
MultiNRC64.735.2
nl2repo33.432
OJBench (python)70.754.7
OmniScience Accuracy55.335.2
OmniScience Non-Hallucination50.150
OSWorld-Verified76.263.3
scicode5949
simplebench79.646.8
simpleqa_verified77.336.9
strongreject9899.5
SWE-bench Multilingual76.973
SWE-bench Pro54.253.8
SWE-bench Verified80.676.8
SWEBench Pro (Public)54.250.7
Tau 3 Banking16.514.2
TauBench V3 - Banking21.414.2
Terminal Bench 2.1 (Best Harness)73.851.3
Terminal-Bench 2.068.550.8
Terminal-Bench 2.17445.7
Terminal-Bench Hard68.534.8
tool_decathlon48.827.8
toolathlon48.827.8
V* (w/ python)96.986.9
vectara_answer_rate99.492.2
vectara_avg_summary_length107.7112
vectara_factual_consistency89.685.8
vectara_hallucination_rate10.414.2
τ²-Bench Telecom (AA run)99.395.9
τ³-Bench67.166

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.