VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-V4-Pro vs Kimi K2.6

DeepSeekvsMoonshot72 shared benchmarks4725 head-to-head
BenchmarkDeepSeek-V4-ProKimi K2.6
AA Agentic Index63.358.7
AA Intelligence5345.1
AA-LCR7076.7
AA-Omniscience-10.66.4
AgentWorldBench - Android55.258.9
AgentWorldBench - MCP63.365.2
AgentWorldBench - OS63.760.8
AgentWorldBench - Overall5353.4
AgentWorldBench - Search27.627.5
AgentWorldBench - SWE59.458.8
AgentWorldBench - Terminal51.352.5
AgentWorldBench - Web50.350.2
aime_202696.796.4
Apex (Pass@1)38.324
Apex Shortlist (Pass@1)90.275.5
apexAgents24.328.5
arena_elo14571461
arena_text_factuality14501455
Artificial Analysis Coding Index59.461.8
browsecomp83.486.3
BrowseComp (w/ Ctx)83.483.2
Chinese SimpleQA (C-SimpleQA)77.775.9
coding_arena_elo15821509
critpt138
FORTRESS (Adversarial)3665.6
FORTRESS (Benign)98.597.2
gdpval4941.4
GDPval-AA (Elo)15541482
GDPval-AA v213071190
Global-MMLU-Lite89.388.4
GPQA Diamond90.591.1
HLE48.237.5
HLE (with tools)48.254
hmmt_feb_202695.294.7
IFBench76.576
imo_answer_bench89.886
itbenchSre38.331.2
livebench73.672.2
livebench_agentic_coding42.646.9
livebench_coding7078.6
livebench_data_analysis74.565.1
livebench_instruction_following62.464.4
livebench_language78.175.1
livebench_math90.784.3
livebench_reasoning82.779.4
LiveCodeBench93.589.6
MCP Atlas74.268.1
MCPAtlas Public (Pass@1)73.666.6
MMLU-Pro87.587.1
OmniScience Accuracy4332.8
OmniScience Non-Hallucination12.260.7
scicode5053.5
simpleqa_verified57.938.7
strongreject98.699.8
SWE-bench Multilingual76.276.7
SWE-bench Pro55.458.6
SWE-bench Verified80.680.2
SWEBench Pro (Public)55.458.6
Tau 3 Banking2620.6
TauBench V3 - Banking30.123.3
Terminal Bench 2.1 (Best Harness)6471.3
Terminal-Bench 2.067.966.7
Terminal-Bench 2.172.165.9
Terminal-Bench Hard46.243.9
toolathlon51.850
usamo_202660.751.2
vectara_answer_rate97.299.7
vectara_avg_summary_length153.8116.7
vectara_factual_consistency91.489.2
vectara_hallucination_rate8.610.8
τ²-Bench Telecom (AA run)96.295.9
τ³-Bench25.820.6

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.