Claude Fable 5.1 vs Qwen3 VL 4B (Reasoning)
12 SHARED BENCHMARKSAcross 12 shared benchmarks, Claude Fable 5.1 scores higher on 12 and Qwen3 VL 4B (Reasoning) on 0. The widest gap is OmniScience Accuracy, where Claude Fable 5.1 scores 67.2 against 12.2.
ANTHROPICVSALIBABA12 SHARED12–0 HEAD-TO-HEAD
Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.
Compare Claude Fable 5.1 withEVERY TRACKED PAIRING
▶Anthropic12 PAIRINGS
▶OpenAI11 PAIRINGS
▶Google9 PAIRINGS
▶Alibaba11 PAIRINGS
▶DeepSeek4 PAIRINGS
▶Moonshot4 PAIRINGS
▶Meta2 PAIRINGS
▶Z.ai2 PAIRINGS
▶MiniMax1 PAIRING
▶NVIDIA2 PAIRINGS
Compare Qwen3 VL 4B (Reasoning) withEVERY TRACKED PAIRING
▶Anthropic12 PAIRINGS
▶OpenAI11 PAIRINGS
▶Google9 PAIRINGS
▶Alibaba11 PAIRINGS
▶DeepSeek4 PAIRINGS
▶Moonshot4 PAIRINGS
▶Meta2 PAIRINGS
▶Z.ai2 PAIRINGS
▶MiniMax1 PAIRING
▶NVIDIA2 PAIRINGS