VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-R1 vs Kimi K2.5

DeepSeekvsMoonshot38 shared benchmarks434 head-to-head
BenchmarkDeepSeek-R1Kimi K2.5
AA Agentic Index3.152.8
AA Intelligence18.636
AA-LCR5673
AA-Omniscience-31.3-7.3
AIME 202587.596.1
arc_agi_121.265.3
ARC-AGI-21.311.8
Artificial Analysis Coding Index24.646.8
browsecomp8.974.9
browsecomp_zh35.762.3
critpt0.63.1
Fortress74.441.1
gdpval1.538.3
GPQA Diamond8187.9
HLE17.750.2
HMMT 202579.495.4
hmmt_feb_202576.795.4
IFBench3970.2
longbench_v258.361
MMLU-Pro8587.1
multichallenge4561.4
MultiNRC27.635.2
OmniScience Accuracy30.735.2
OmniScience Non-Hallucination10.550
scicode35.749
simplebench40.846.8
simpleqa_verified27.436.9
SWE-bench Multilingual30.573
SWE-bench Verified57.676.8
TauBench V3 - Banking6.414.2
Terminal-Bench 2.119.145.7
Terminal-Bench Hard6.134.8
vectara_answer_rate9792.2
vectara_avg_summary_length93.5112
vectara_factual_consistency88.785.8
vectara_hallucination_rate11.314.2
τ²-Bench Telecom (AA run)11.495.9
τ³-Bench6.466

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.