Qwen3 VL 235B A22B Reasoning vs Qwen3 VL 4B (Reasoning)
52 SHARED BENCHMARKSAcross 52 shared benchmarks, Qwen3 VL 235B A22B Reasoning scores higher on 50 and Qwen3 VL 4B (Reasoning) on 1, with 1 level. The widest gap is Terminal-Bench Hard, where Qwen3 VL 235B A22B Reasoning scores 11.4 against 1.5.
ALIBABAVSALIBABA52 SHARED50–1 HEAD-TO-HEAD
Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.
Compare Qwen3 VL 235B A22B Reasoning withEVERY TRACKED PAIRING
▶Anthropic12 PAIRINGS
▶OpenAI11 PAIRINGS
▶Google10 PAIRINGS
▶Alibaba10 PAIRINGS
▶DeepSeek4 PAIRINGS
▶Moonshot4 PAIRINGS
▶Meta2 PAIRINGS
▶Z.ai2 PAIRINGS
▶MiniMax1 PAIRING
▶NVIDIA2 PAIRINGS
Compare Qwen3 VL 4B (Reasoning) withEVERY TRACKED PAIRING
▶Anthropic12 PAIRINGS
▶OpenAI11 PAIRINGS
▶Google10 PAIRINGS
▶Alibaba10 PAIRINGS
▶DeepSeek4 PAIRINGS
▶Moonshot4 PAIRINGS
▶Meta2 PAIRINGS
▶Z.ai2 PAIRINGS
▶MiniMax1 PAIRING
▶NVIDIA2 PAIRINGS