VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Gemini 3 Flash Preview vs Kimi K2.5

GooglevsMoonshot51 shared benchmarks3515 head-to-head
BenchmarkGemini 3 Flash PreviewKimi K2.5
AA Agentic Index49.752.8
AA Intelligence38.736
AA-LCR7373
AA-Omniscience10.1-7.3
AIME 202599.796.1
aime_202696.795.8
apexAgents27.711.5
arc_agi_184.765.3
ARC-AGI-233.611.8
arena_elo14731450
arena_text_factuality14521445
arena_vision12601247
Artificial Analysis Coding Index42.646.8
charxiv_rq80.378.7
coding_arena_elo13871436
critpt8.63.1
frontiermath_tier_44.24.2
gdpval35.238.3
GPQA Diamond90.487.9
HLE43.550.2
hmmt_feb_202597.595.4
hmmt_feb_202689.487.1
hmmt_nov_202593.391.1
IFBench7870.2
livebench72.469.1
matharena_visual_math_overall85.880.6
MCP Atlas6264
MMMU-Pro81.278.5
OmniDocBench 1.512.188.8
OmniScience Accuracy53.435.2
OmniScience Non-Hallucination7.650
OSWorld-Verified65.163.3
scicode50.649
simplebench61.146.8
simpleqa_verified67.436.9
swe_bench_bash75.870.8
SWE-bench Multilingual72.773
SWE-bench Pro49.653.8
SWE-bench Verified7876.8
TauBench V3 - Banking20.814.2
Terminal-Bench 2.047.650.8
Terminal-Bench 2.15845.7
Terminal-Bench Hard38.634.8
toolathlon49.427.8
vectara_answer_rate99.892.2
vectara_avg_summary_length90.2112
vectara_factual_consistency86.585.8
vectara_hallucination_rate13.514.2
VideoMMMU86.986.6
τ²-Bench Telecom (AA run)80.495.9
τ³-Bench17.566

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.