VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.1 vs Kimi K2.5

OpenAIvsMoonshot49 shared benchmarks2821 head-to-head
BenchmarkGPT-5.1Kimi K2.5
AA Agentic Index32.252.8
AA Intelligence37.536
AA-LCR76.773
AA-Omniscience5.4-7.3
AIME 202594.296.1
arc_agi_172.865.3
ARC-AGI-217.611.8
arena_elo14391450
arena_text_factuality14451445
arena_vision12501247
Artificial Analysis Coding Index49.446.8
browsecomp50.874.9
coding_arena_elo14211436
critpt4.93.1
Fortress25.741.1
frontiermath_tier_412.54.2
gdpval2538.3
GPQA Diamond88.187.9
HLE28.550.2
HLE (with tools)42.751.8
hmmt_feb_202596.395.4
hmmt_nov_202591.791.1
IFBench72.970.2
LiveCodeBench v68785
matharena_visual_math_overall76.980.6
MCP Atlas50.164
MMLU-Pro8787.1
MMMU-Pro75.578.5
multichallenge63.461.4
MultiNRC4935.2
OmniScience Accuracy37.735.2
OmniScience Non-Hallucination48.150
scicode43.349
SEAL VISTA43.841.9
simplebench53.246.8
simpleqa_verified48.936.9
swe_bench_bash6670.8
SWE-bench Verified76.376.8
TauBench V3 - Banking15.914.2
Terminal-Bench 2.047.650.8
Terminal-Bench 2.152.445.7
Terminal-Bench Hard45.534.8
vectara_answer_rate10092.2
vectara_avg_summary_length254.4112
vectara_factual_consistency89.185.8
vectara_hallucination_rate12.114.2
τ²-Bench82.785.4
τ²-Bench Telecom (AA run)81.995.9
τ³-Bench1466

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.