VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.1 vs Kimi K2 (Reasoning)

OpenAIvsMoonshot33 shared benchmarks267 head-to-head
BenchmarkGPT-5.1Kimi K2 (Reasoning)
AA Agentic Index32.247.9
AA Intelligence37.533.5
AA-LCR76.770.3
AA-Omniscience5.4-21.4
AIME 202594.294.5
Artificial Analysis Coding Index49.434.8
browsecomp50.860.2
critpt4.92.6
frontiermath_tier_412.50
gdpval2524.5
GPQA Diamond88.184.5
HLE28.523.9
HLE (with tools)42.744.9
hmmt_feb_202596.393.3
hmmt_nov_202591.789.2
IFBench72.968.1
LiveCodeBench v68783.1
MMLU-Pro8784.6
multichallenge63.466.4
OmniScience Accuracy37.730.9
OmniScience Non-Hallucination48.125.8
scicode43.344.8
simplebench53.239.6
swe_bench_bash6663.4
SWE-bench Verified76.371.3
Terminal-Bench 2.047.635.7
Terminal-Bench Hard45.531.1
vectara_answer_rate10098.6
vectara_avg_summary_length254.459.2
vectara_factual_consistency89.182.1
vectara_hallucination_rate12.117.9
τ²-Bench82.774.3
τ²-Bench Telecom (AA run)81.993

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.