VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-4o vs Qwen3 VL 4B (Reasoning)

OpenAIvsAlibaba38 shared benchmarks2017 head-to-head
BenchmarkGPT-4oQwen3 VL 4B (Reasoning)
AA Agentic Index9.714.4
AA Intelligence11.27.7
AA-LCR5523
AA-Omniscience-10.5-68.4
AI2D94.284.9
AIME 20249.372.9
AIME 202511.774.5
Artificial Analysis Coding Index24.26.7
chartqa88.184
critpt00
ERQA35.247.3
gdpval013.8
GPQA Diamond70.164.1
HLE5.34.6
IFBench3636.6
ifeval84.382.6
LiveCodeBench38.351.3
LiveCodeBench v630.951.3
mathvision30.460
MathVista63.879.5
mmlu_prox61.165
mmlu_redux8886
MMLU-Pro74.773.6
MMMU (val) (Pass@1)69.170.8
MMMU-Pro59.957
MMStar63.973.2
OCRBench80681.6
OmniScience Accuracy23.712.2
OmniScience Non-Hallucination62.18.2
OSWorld-Verified531.4
RealWorldQA75.473.2
scicode33.417.1
supergpqa42.446.8
Terminal-Bench Hard8.31.5
Video-MME77.259.7
VideoMMMU61.269.4
VSI-Bench3455.2
τ²-Bench Telecom (AA run)28.915.5

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.