VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 3 Pro vs Kimi K2.5

GooglevsMoonshot83 shared benchmarks5230 head-to-head
BenchmarkGemini 3 ProKimi K2.5
AA Agentic Index5252.8
AA Intelligence40.636
AA-LCR7373
AA-Omniscience15.3-7.3
AIME 202510096.1
AIME 2026 I90.692.5
aime_202691.795.8
apexAgents18.411.5
arc_agi_17565.3
ARC-AGI-25411.8
arena_elo14851450
arena_text_factuality14811445
arena_vision12901247
Artificial Analysis Coding Index46.546.8
browsecomp59.274.9
BrowseComp (context management)67.674.9
browsecomp_with_context_manager59.274.9
browsecomp_zh66.862.3
charxiv_rq81.478.7
coding_arena_elo14381436
critpt9.13.1
cybergym39.941.3
deepsearchqa_f163.289
FinSearchCompT2&T349.967.8
Fortress41.741.1
frontiermath_tier_418.84.2
gdpval34.238.3
GPQA Diamond91.987.9
HLE45.850.2
HLE (with tools)45.851.8
hmmt_feb_202597.595.4
hmmt_feb_202686.487.1
hmmt_nov_202593.391.1
IFBench70.470.2
imo_answer_bench83.381.8
InfoVQA (val)57.292.6
livebench73.469.1
LiveCodeBench v690.785
longbench_v268.261
LongVideoBench77.779.8
LVBench73.575.9
matharena_visual_math_overall84.280.6
mathvision86.184.2
MathVista89.890.1
MCP Atlas70.364
MMLU-Pro90.187.1
MMMU-Pro8178.5
MMVU78.980.4
MotionBench70.370.4
multichallenge65.761.4
MultiNRC5935.2
OCRBench90.392.3
OJ-Bench (cpp)68.557.4
OJBench (cpp)68.557.4
OmniDocBench 1.588.588.8
OmniScience Accuracy55.835.2
OmniScience Non-Hallucination1050
scicode56.149
SEAL VISTA51.541.9
Seal-045.557.4
simplebench76.446.8
simpleqa_verified72.936.9
SimpleVQA69.771.2
swe_bench_bash74.270.8
SWE-bench Multilingual68.773
SWE-bench Pro43.353.8
SWE-bench Verified7876.8
Terminal-Bench 2.054.250.8
Terminal-Bench Hard56.934.8
tool_decathlon36.427.8
toolathlon36.427.8
vectara_answer_rate99.492.2
vectara_avg_summary_length101.9112
vectara_factual_consistency86.485.8
vectara_hallucination_rate13.614.2
Video-MME88.487.4
VideoMMMU87.686.6
WideSearch (item-f1)5772.7
WorldVQA47.446.3
ZeroBench89
ZeroBench (w/ tools)1211
τ²-Bench9885.4
τ²-Bench Telecom (AA run)9895.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.