VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs Kimi K2 (Reasoning)

AnthropicvsMoonshot44 shared benchmarks1625 head-to-head
BenchmarkClaude Sonnet 4Kimi K2 (Reasoning)
AA Agentic Index39.247.9
AA Intelligence29.833.5
AA-LCR69.770.3
AA-Omniscience0.2-21.4
aider_polyglot70.759.1
AIME 20257494.5
ArtifactsBench57.354.2
Artificial Analysis Coding Index37.634.8
browsecomp12.260.2
browsecomp_zh29.162.3
critpt1.12.6
FinSearchComp-global4229.5
frontiermath_tier_400
GAIA (text only)68.360.2
gdpval31.224.5
GPQA Diamond7884.5
HLE10.723.9
HLE (with tools)20.344.9
HMMT 202515.989.4
IFBench5568.1
LiveCodeBench68.579.2
LiveCodeBench v648.583.1
mmlu_redux93.694.4
MMLU-Pro8484.6
Multi-SWE-Bench35.741.9
multichallenge57.166.4
OmniScience Accuracy22.730.9
OmniScience Non-Hallucination70.925.8
scicode4044.8
simplebench45.539.6
swe_bench_bash64.963.4
SWE-bench Multilingual56.961.1
SWE-bench Verified80.271.3
SWE-Dev67.166.6
Terminal-Bench36.447.1
Terminal-Bench Hard31.131.1
theagentcompany3730
vectara_answer_rate98.698.6
vectara_avg_summary_length145.859.2
vectara_factual_consistency89.782.1
vectara_hallucination_rate10.317.9
xbench_deepsearch64.676
τ²-Bench6574.3
τ²-Bench Telecom (AA run)64.693

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.