VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-4o vs Kimi K2 (Reasoning)

OpenAIvsMoonshot30 shared benchmarks624 head-to-head
BenchmarkGPT-4oKimi K2 (Reasoning)
AA Agentic Index9.747.9
AA Intelligence11.233.5
AA-LCR5570.3
AA-Omniscience-10.5-21.4
aider_polyglot30.759.1
AIME 202511.794.5
Artificial Analysis Coding Index24.234.8
critpt02.6
gdpval024.5
GPQA Diamond70.184.5
HLE5.323.9
IFBench3668.1
LiveCodeBench38.379.2
LiveCodeBench v630.983.1
longbench_v248.145.1
mmlu_redux8894.4
MMLU-Pro74.784.6
multichallenge40.366.4
OmniScience Accuracy23.730.9
OmniScience Non-Hallucination62.125.8
scicode33.444.8
simplebench17.839.6
swe_bench_bash21.663.4
SWE-bench Verified38.871.3
Terminal-Bench Hard8.331.1
vectara_answer_rate93.898.6
vectara_avg_summary_length86.659.2
vectara_factual_consistency90.482.1
vectara_hallucination_rate9.617.9
τ²-Bench Telecom (AA run)28.993

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.