VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.2 vs Kimi K2.5

OpenAIvsMoonshot78 shared benchmarks4631 head-to-head
BenchmarkGPT-5.2Kimi K2.5
AA Agentic Index60.252.8
AA Intelligence43.336
AA-LCR79.373
AA-Omniscience0.3-7.3
AIME 202510096.1
aime_202698.395.8
apexAgents2311.5
arc_agi_186.265.3
ARC-AGI-252.911.8
arena_elo14371450
arena_text_factuality14421445
arena_vision12451247
Artificial Analysis Coding Index48.746.8
browsecomp65.874.9
BrowseComp (context management)7074.9
browsecomp_with_context_manager65.874.9
browsecomp_zh76.162.3
charxiv_rq82.178.7
coding_arena_elo14181436
critpt11.63.1
deepsearchqa_f171.389
Fortress17.541.1
frontiermath_tier_418.84.2
gdpval48.338.3
GPQA Diamond92.487.9
HLE45.550.2
HLE (with tools)45.551.8
HMMT 202599.495.4
hmmt_feb_202510095.4
hmmt_feb_20269787.1
hmmt_nov_202599.291.1
IFBench75.470.2
imo_answer_bench86.381.8
InfoVQA (val)8492.6
livebench74.869.1
longbench_v254.561
LongVideoBench76.579.8
matharena_visual_math_overall86.580.6
mathvision8384.2
MathVista82.890.1
MCP Atlas6864
MMLU-Pro8787.1
MMMU-Pro79.578.5
MMVU80.880.4
MotionBench64.870.4
MultiNRC42.235.2
OCRBench80.792.3
OmniDocBench 1.585.788.8
OmniScience Accuracy44.335.2
OmniScience Non-Hallucination38.450
PaperBench63.763.5
scicode52.149
SEAL VISTA46.641.9
Seal-04557.4
simplebench45.846.8
simpleqa_verified38.936.9
SimpleVQA55.871.2
swe_bench_bash72.870.8
SWE-bench Multilingual7273
SWE-bench Pro55.653.8
SWE-bench Verified8076.8
TauBench V3 - Banking11.114.2
Terminal-Bench 2.05450.8
Terminal-Bench Hard62.234.8
tool_decathlon46.327.8
toolathlon46.327.8
vectara_answer_rate10092.2
vectara_avg_summary_length186.3112
vectara_factual_consistency89.285.8
vectara_hallucination_rate10.814.2
Video-MME8687.4
VideoMMMU85.986.6
WorldVQA2846.3
ZeroBench99
ZeroBench (w/ tools)711
τ²-Bench85.585.4
τ²-Bench Telecom (AA run)98.795.9
τ³-Bench1266

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.