VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs Kimi K2.5

AnthropicvsMoonshot47 shared benchmarks1136 head-to-head
BenchmarkClaude Sonnet 4Kimi K2.5
AA Agentic Index39.252.8
AA Intelligence29.836
AA-LCR69.773
AA-Omniscience0.2-7.3
AIME 20257496.1
arc_agi_163.765.3
ARC-AGI-213.611.8
arena_vision12071247
Artificial Analysis Coding Index37.646.8
browsecomp12.274.9
browsecomp_zh29.162.3
critpt1.13.1
Fortress24.441.1
frontiermath_tier_404.2
gdpval31.238.3
GPQA Diamond7887.9
HLE10.750.2
HLE (with tools)20.351.8
HMMT 202515.995.4
IFBench5570.2
livebench74.869.1
LiveCodeBench v648.585
MMLU-Pro8487.1
MMMU-Pro62.478.5
multichallenge57.161.4
MultiNRC18.435.2
OmniScience Accuracy22.735.2
OmniScience Non-Hallucination70.950
OSWorld-Verified42.263.3
scicode4049
SEAL VISTA45.541.9
simplebench45.546.8
swe_bench_bash64.970.8
SWE-bench Multilingual56.973
SWE-bench Pro42.753.8
SWE-bench Verified80.276.8
TauBench V3 - Banking16.714.2
Terminal-Bench 2.136.345.7
Terminal-Bench Hard31.134.8
vectara_answer_rate98.692.2
vectara_avg_summary_length145.8112
vectara_factual_consistency89.785.8
vectara_hallucination_rate10.314.2
xbench_deepsearch64.676.7
τ²-Bench6585.4
τ²-Bench Telecom (AA run)64.695.9
τ³-Bench13.866

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.