VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.5 vs Kimi K2.5

AnthropicvsMoonshot81 shared benchmarks4437 head-to-head
BenchmarkClaude Opus 4.5Kimi K2.5
AA Agentic Index59.652.8
AA Intelligence41.936
AA-LCR7673
AA-Omniscience14-7.3
AIME 202592.896.1
AIME 2026 I93.392.5
aime_202695.195.8
arc_agi_18265.3
ARC-AGI-237.611.8
arena_elo14731450
arena_text_factuality14581445
Artificial Analysis Coding Index47.846.8
browsecomp3774.9
BrowseComp (context management)59.274.9
browsecomp_with_context_manager67.874.9
browsecomp_zh62.462.3
charxiv_rq68.578.7
coding_arena_elo14951436
critpt4.63.1
cybergym50.641.3
deepsearchqa_f176.189
FinSearchCompT2&T366.267.8
Fortress13.641.1
frontiermath_tier_44.24.2
gdpval47.338.3
GPQA Diamond8787.9
HLE30.850.2
HLE (with tools)43.451.8
hmmt_feb_202592.995.4
hmmt_feb_202685.387.1
hmmt_nov_202593.391.1
IFBench5870.2
imo_answer_bench8481.8
InfoVQA (val)76.992.6
livebench7669.1
LiveCodeBench v684.885
longbench_v264.461
LongVideoBench67.279.8
mathvision77.184.2
MathVista80.290.1
MCP Atlas69.864
MMLU-Pro9087.1
MMMU-Pro7478.5
MMVU77.380.4
MotionBench60.370.4
multichallenge5961.4
MultiNRC48.635.2
nl2repo43.232
OCRBench86.592.3
OJ-Bench (cpp)54.657.4
OJBench (cpp)54.657.4
OmniDocBench 1.587.788.8
OmniScience Accuracy46.635.2
OmniScience Non-Hallucination3950
OSWorld-Verified66.363.3
PaperBench72.963.5
scicode5049
SEAL VISTA46.441.9
Seal-047.757.4
simplebench6246.8
simpleqa_verified41.836.9
SimpleVQA69.771.2
swe_bench_bash76.870.8
SWE-bench Multilingual77.573
SWE-bench Pro57.153.8
SWE-bench Verified81.576.8
Terminal-Bench 2.059.350.8
Terminal-Bench Hard4734.8
tool_decathlon43.527.8
toolathlon43.527.8
vectara_answer_rate98.792.2
vectara_avg_summary_length114.5112
vectara_factual_consistency89.185.8
vectara_hallucination_rate10.914.2
VideoMMMU84.486.6
WideSearch (item-f1)76.272.7
WorldVQA36.846.3
ZeroBench39
ZeroBench (w/ tools)911
τ²-Bench98.285.4
τ²-Bench Telecom (AA run)89.595.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.