VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-V3.2 vs GPT-5.4

DeepSeekvsOpenAI46 shared benchmarks343 head-to-head
BenchmarkDeepSeek-V3.2GPT-5.4
AA Agentic Index39.858.2
AA Intelligence32.853.1
AA-LCR70.777.7
AA-Omniscience-22.55.8
aime_202695.199.2
apexAgents14.533.3
arc_agi_15793.7
ARC-AGI-2474
arena_text_factuality14331476
Artificial Analysis Coding Index44.271.1
browsecomp51.482.7
browsecomp_with_context_manager67.682.7
coding_arena_elo13681457
critpt2.923.4
cybergym17.366.3
deepsearchqa_f160.978.6
frontiermath_tier_42.127.1
gdpval18.850.1
GPQA Diamond8493
HLE40.843.7
HLE (with tools)40.852.1
hmmt_feb_202684.197.7
hmmt_nov_202590.295.8
IFBench6173.9
imo_answer_bench78.391.4
MCP Atlas62.270.6
mcpmark3862.5
MMLU-Pro8687.5
OmniScience Accuracy3350.9
OmniScience Non-Hallucination17.317.4
scicode3956.6
simpleqa_verified27.545.3
SWE-bench Multilingual70.271.7
SWE-bench Pro15.659.1
TauBench V3 - Banking18.839.6
Terminal-Bench 2.046.475.1
Terminal-Bench 2.146.878.3
Terminal-Bench Hard35.657.6
tool_decathlon35.254.6
toolathlon35.254.6
vectara_answer_rate92.699.9
vectara_avg_summary_length6281.7
vectara_factual_consistency93.793
vectara_hallucination_rate6.37
τ²-Bench Telecom (AA run)90.687.1
τ³-Bench69.272.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.