VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

DeepSeek-V4-Pro vs Qwen3.5 397B A17B

DeepSeekvsAlibaba50 shared benchmarks3812 head-to-head
BenchmarkDeepSeek-V4-ProQwen3.5 397B A17B
AA Agentic Index63.353.3
AA Intelligence5334.3
AA-LCR7072.7
AA-Omniscience-10.6-30.8
AgentWorldBench - Android55.254.9
AgentWorldBench - MCP63.368.3
AgentWorldBench - OS63.760.9
AgentWorldBench - Overall5354.7
AgentWorldBench - Search27.630.8
AgentWorldBench - SWE59.464.4
AgentWorldBench - Terminal51.355.3
AgentWorldBench - Web50.348.5
aime_202696.794.2
apexAgents24.315.3
arena_elo14571442
arena_text_factuality14501445
Artificial Analysis Coding Index59.448.2
browsecomp83.469
coding_arena_elo15821399
critpt131.7
gdpval4935.8
GDPval-AA v21307962
Global-MMLU-Lite89.390
GPQA Diamond90.589.3
HLE48.229
HLE (with tools)48.248.3
hmmt_feb_202695.287.9
hmmt_nov_202594.492.7
IFBench76.578.8
imo_answer_bench89.880.9
itbenchSre38.334.1
MMLU-Pro87.587.8
nl2repo38.532.2
OmniScience Accuracy4330.8
OmniScience Non-Hallucination12.217.3
scicode5042
simpleqa_verified57.926
strongreject98.699.4
SWE-bench Multilingual76.269.3
SWE-bench Pro55.450.9
SWE-bench Verified80.676.4
Tau 3 Banking2613.4
TauBench V3 - Banking30.113.4
Terminal-Bench 2.067.952.5
Terminal-Bench 2.172.151.3
Terminal-Bench Hard46.240.9
toolathlon51.838.3
usamo_202660.736.3
τ²-Bench Telecom (AA run)96.295.6
τ³-Bench25.813.4

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.