VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-V4-Pro vs GPT-5.2

DeepSeekvsOpenAI51 shared benchmarks3021 head-to-head
BenchmarkDeepSeek-V4-ProGPT-5.2
AA Agentic Index63.360.2
AA Intelligence5343.3
AA-LCR7079.3
AA-Omniscience-10.60.3
aime_202696.798.3
apexAgents24.323
arena_elo14571437
arena_text_factuality14501442
Artificial Analysis Coding Index59.448.7
browsecomp83.465.8
coding_arena_elo15821418
critpt1311.6
gdpval4948.3
GDPval-AA (Elo)15541462
GPQA Diamond90.592.4
HLE48.245.5
HLE (with tools)48.245.5
hmmt_feb_202695.297
hmmt_nov_202594.499.2
IFBench76.575.4
imo_answer_bench89.886.3
livebench73.674.8
livebench_agentic_coding42.650.3
livebench_coding7076.1
livebench_data_analysis74.578.2
livebench_instruction_following62.461.8
livebench_language78.179.8
livebench_math90.793.2
livebench_reasoning82.783.2
LiveCodeBench93.589
MCP Atlas74.268
MMLU-Pro87.587
OmniScience Accuracy4344.3
OmniScience Non-Hallucination12.238.4
scicode5052.1
simplebench50.945.8
simpleqa_verified57.938.9
SWE-bench Multilingual76.272
SWE-bench Pro55.455.6
SWE-bench Verified80.680
TauBench V3 - Banking30.111.1
Terminal-Bench 2.067.954
Terminal-Bench Hard46.262.2
tool_decathlon52.846.3
toolathlon51.846.3
vectara_answer_rate97.2100
vectara_avg_summary_length153.8186.3
vectara_factual_consistency91.489.2
vectara_hallucination_rate8.610.8
τ²-Bench Telecom (AA run)96.298.7
τ³-Bench25.812

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.