VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

MMMU

65 models tracked

MMMU (Massive Multi-discipline Multimodal Understanding) — Standard MMMU val split; raws absorb 'MMMU (val, Pass@1)'.

#ModelVendorBest scoreRunsLast seen
1Qwen3.6 PlusAlibaba8612026-08-23
2GPT-5.1 InstantOpenAI85.412026-08-23
3GPT-5.1OpenAI85.412026-08-23
4Qwen3.5 397B A17BAlibaba8512026-06-15
5GPT-5OpenAI84.212026-08-23
6Qwen3.5 122B A10BAlibaba83.912026-08-23
7Gemini 2.5 ProGoogle83.932026-08-23
8Qwen3.6 27BAlibaba82.922026-08-23
9o3OpenAI82.912026-08-23
10Qwen3.5 27BAlibaba82.332026-08-24
11Gemini 2.5 Pro Preview 06.05 (32k think)Google8212026-08-24
12Qwen3.6 35B A3BAlibaba81.732026-08-24
13o4-miniOpenAI81.612026-08-23
14Qwen3.5 35B A3BAlibaba81.422026-08-24
15Claude Opus 4.5Anthropic80.722026-07-29
16Gemma 4 31BGoogle80.422026-08-24
17Step3 VL 10BStepFun80.132026-08-23
18Gemini 2.5 FlashGoogle79.712026-08-23
19Claude Sonnet 4.5Anthropic79.612026-08-24
20Qwen3 VL 235B A22B ReasoningAlibaba78.712026-06-05
21Gemma 4 26B A4BGoogle78.412026-08-24
22Grok 3SpaceXAI7812026-08-23
23o1OpenAI77.612026-08-23
24Gemini 2.0 Flash (Reasoning)Google75.412026-08-23
25GPT-4.5 PreviewOpenAI75.212026-08-23
26GLM-4.6V (106B-A12B)Z.ai75.222026-06-05
27Command A+Cohere75.112026-08-23
28Claude 3.7 SonnetAnthropic7512026-08-23
29GPT-4.1OpenAI74.812026-08-23
30Claude Sonnet 4Anthropic74.422026-08-23
31Claude 4 OpusAnthropic73.712026-06-13
32Qwen3 VL Thinking (8B)Alibaba73.522026-06-05
33Llama 4 MaverickMeta73.422026-08-23
34Grok 3 BetaSpaceXAI73.212026-07-13
35Gemini 2.5 Flash LiteGoogle72.912026-08-23
36GPT-4.1 miniOpenAI72.712026-08-23
37GPT-4oOpenAI72.242026-08-23
38Claude 3.5 SonnetAnthropic7232026-08-23
39InternVL-3.5 (8B)OpenGVLab71.722026-06-05
40GLM-4.6V-Flash (9B)Z.ai71.222026-06-05
41MiMo VL RL 2508 (7B)Xiaomi71.122026-06-05
42Gemini 2.0 Flash ExpGoogle70.612026-06-05
43Qwen2.5 VL 72BAlibaba70.222026-08-23
44Qwen2.5 VL 32BAlibaba7022026-08-23
45Llama 4 ScoutMeta69.422026-08-23
46Grok 3 Mini BetaSpaceXAI69.412026-07-13
47MiniMax VL 01MiniMax68.512026-06-05
48Gemini 1.5 ProGoogle68.432026-08-23
49InternVL2.5-78BOpenGVLab66.512026-06-05
50Grok 2SpaceXAI66.112026-08-23
51Gemma 3 27BGoogle64.912026-06-05
52Kimi VL A3B ThinkingMoonshot6422026-06-05
53Pixtral LargeMistral6412026-08-23
54Grok 2 MiniSpaceXAI63.212026-08-23
55Llama 3.2 Instruct 90B (Vision)Meta62.112026-06-05
56Nova Pro (Non-Reasoning)Amazon61.712026-08-23
57Gemma 3 12BGoogle59.612026-06-05
58GPT-4o miniOpenAI59.412026-08-23
59Qwen2.5 Omni 7BAlibaba59.212026-08-23
60Kimi VL A3B InstructMoonshot5712026-06-05
61Nova Lite (Non-Reasoning)Amazon56.212026-08-23
62GPT-4.1 nanoOpenAI55.412026-08-23
63Phi 4 Multimodal InstructMicrosoft55.112026-08-23
64Gemini 1.5 Flash 8BGoogle53.712026-08-23
65Phi 3.5 Vision InstructMicrosoft4312026-08-23

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.