VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5 vs Kimi K2 (Reasoning)

OpenAIvsMoonshot70 shared benchmarks4918 head-to-head
BenchmarkGPT-5Kimi K2 (Reasoning)
AA Agentic Index49.747.9
AA Intelligence35.333.5
AA-LCR76.370.3
AA-Omniscience-8.7-21.4
aider_polyglot8859.1
AIME 20259594.5
AIME25 heavy100100
AIME25 no tools94.694.5
AIME25 w/ python99.699.1
Arena-Hard (Creative Writing)92.280.1
Arena-Hard (Hard Prompt)71.971.9
ArtifactsBench7354.2
Artificial Analysis Coding Index38.934.8
browsecomp54.960.2
BrowseComp w/ tools54.960.2
browsecomp_zh6562.3
BrowseComp-ZH w/ tools6362.3
critpt5.72.6
FinSearchComp-global63.929.5
FinSearchComp-T348.547.4
FinSearchComp-T3 w/ tools48.547.4
Frames8687
Frames w/ tools8687
frontiermath_tier_412.50
GAIA (text only)76.460.2
gdpval32.524.5
GPQA (unspecified)85.774.2
GPQA Diamond87.384.5
HealthBench67.258
HealthBench no tools67.258
HLE28.523.9
HLE (with tools)35.244.9
HMMT 202593.389.4
hmmt_feb_202588.393.3
hmmt_nov_202589.289.2
HMMT25 heavy10097.5
HMMT25 no tools93.389.4
HMMT25 w/ python96.795.1
IFBench73.168.1
imo_answer_bench7678.6
LiveCodeBench8579.2
LiveCodeBench v68783.1
LiveCodeBenchV6 no tools8783.1
Longform Writing eval (Kimi K2 Thinking system card)71.473.8
mmlu_redux95.394.4
MMLU-Pro87.584.6
Multi-SWE-Bench39.341.9
multichallenge71.166.4
OJ-Bench (cpp)56.248.7
OJ-Bench (cpp) no tools56.248.7
OmniScience Accuracy40.330.9
OmniScience Non-Hallucination2125.8
scicode4344.8
Seal-051.456.3
Seal-0 w/ tools51.456.3
simplebench56.739.6
swe_bench_bash6563.4
SWE-bench Multilingual55.361.1
SWE-bench Verified74.971.3
Terminal-Bench43.847.1
Terminal-Bench 2.035.235.7
Terminal-Bench Hard37.931.1
Terminal-Bench w/ simulated tools (JSON)43.847.1
vectara_answer_rate99.998.6
vectara_avg_summary_length162.759.2
vectara_factual_consistency85.382.1
vectara_hallucination_rate14.717.9
xbench_deepsearch77.876
τ²-Bench8574.3
τ²-Bench Telecom (AA run)86.593

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.