VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4 vs Qwen3 VL 4B (Reasoning)

AnthropicvsAlibaba26 shared benchmarks224 head-to-head
BenchmarkClaude Sonnet 4Qwen3 VL 4B (Reasoning)
AA Agentic Index39.214.4
AA Intelligence29.87.7
AA-LCR69.723
AA-Omniscience0.2-68.4
AIME 202443.472.9
AIME 20257474.5
Artificial Analysis Coding Index37.66.7
critpt1.10
gdpval31.213.8
GPQA Diamond7864.1
HLE10.74.6
HMMT 202515.953.1
IFBench5536.6
ifeval87.682.6
LiveCodeBench68.551.3
LiveCodeBench v648.551.3
mmlu_redux93.686
MMLU-Pro8473.6
MMMU-Pro62.457
OmniScience Accuracy22.712.2
OmniScience Non-Hallucination70.98.2
OSWorld-Verified42.231.4
scicode4017.1
supergpqa55.746.8
Terminal-Bench Hard31.11.5
τ²-Bench Telecom (AA run)64.615.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.