VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.4 vs Qwen3.5 35B A3B

OpenAIvsAlibaba51 shared benchmarks474 head-to-head
BenchmarkGPT-5.4Qwen3.5 35B A3B
AA Agentic Index58.244.1
AA Intelligence53.129.9
AA-LCR77.768.3
AA-Omniscience5.8-48.1
AgentWorldBench - Android6053.2
AgentWorldBench - MCP70.157.9
AgentWorldBench - OS68.656.3
AgentWorldBench - Overall58.347.7
AgentWorldBench - Search37.326
AgentWorldBench - SWE66.347.6
AgentWorldBench - Terminal53.746.1
AgentWorldBench - Web51.847.1
aime_202699.293.3
Artificial Analysis Coding Index71.137
baby_vision49.738.4
browsecomp82.761
charxiv_rq82.877.5
coding_arena_elo14571250
critpt23.40.9
gdpval50.120.3
GPQA Diamond9384.5
HLE43.747.4
hmmt_feb_202697.781.8
hmmt_nov_202595.889.2
IFBench73.972.5
imo_answer_bench91.476.8
itbenchSre34.521.5
mathvision9283.9
MCP Atlas70.662.4
mcpmark62.527
MMLU-Pro87.585.3
MMMU-Pro81.275.1
nl2repo41.320.5
OmniDocBench 1.589.189.3
OmniScience Accuracy50.920.1
OmniScience Non-Hallucination17.414.6
OSWorld-Verified7554.5
scicode56.637.7
SWE-bench Multilingual71.760.3
SWE-bench Pro59.144.6
TauBench V3 - Banking39.64.9
Terminal-Bench 2.075.140.5
Terminal-Bench 2.178.340.8
Terminal-Bench Hard57.626.5
tool_decathlon54.628.7
vectara_answer_rate99.999.8
vectara_avg_summary_length81.794.9
vectara_factual_consistency9389.5
vectara_hallucination_rate710.5
τ²-Bench Telecom (AA run)87.189.2
τ³-Bench72.968.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.