Skip to content
VECTOR WIREAI INTELLIGENCE
UTC

MMMU leaderboard — the family board.

8 TRACKED VARIANTS · 2 FIRST-CLASS BOARDS

One family, 8 tracked prints: MMMU-Pro is cited standalone and keeps live board of its own. Scoring configs and splits of the base board render as sections of this page, each under its own honest label.

● LIVE DATA69 MODELS ON THIS BOARDLEADER QWEN3.6 PLUS AT 86

First-class boards in this familyCITED STANDALONE · EACH KEEPS ITS OWN LIVE BOARD

#BoardModels scored
02MMMUTHIS PAGE69

The board — MMMUTOP 69 OF 69 MEASURED · BEST SCORE PER MODEL, DEFAULT VARIANT

#ModelVendorScoreVLast seen
01Qwen3.6 PlusAlibaba862026-08-23
02GPT-5.1 InstantOpenAI85.42026-08-23
03GPT-5.1OpenAI85.42026-08-23
04Qwen3.5 397B A17BAlibaba852026-06-15
05GPT-5OpenAI84.22026-08-23
06Qwen3.5 122B A10BAlibaba83.92026-08-23
07Gemini 2.5 ProGoogle83.92026-09-03
08Seed 1.8ByteDance83.42026-09-09
09o3OpenAI82.92026-08-23
10Qwen3.6 27BAlibaba82.92026-08-23
11Qwen3.5 27BAlibaba82.32026-08-24
12Qwen3.6 35B A3BAlibaba81.72026-08-24
13o4-miniOpenAI81.62026-08-23
14Qwen3.5 35B A3BAlibaba81.42026-08-24
15Claude Opus 4.5Anthropic80.72026-07-29
16Gemma 4 31BGoogle80.42026-08-24
17Step3 VL 10BStepFun80.12026-08-23
18Gemini 2.5 FlashGoogle79.72026-08-23
19Claude Sonnet 4.5Anthropic79.62026-08-24
20Seed 1.5 VLByteDance79.12026-06-05
21Qwen3 VL 235B A22B ReasoningAlibaba78.72026-06-05
22EXAONE 4.5 33BLG AI78.72026-08-26
23Gemma 4 26B A4BGoogle78.42026-08-24
24Grok 3SpaceXAI782026-08-23
25o1OpenAI77.62026-08-23
26Gemini 2.0 Flash (Reasoning)Google75.42026-08-23
27GPT-4.5 PreviewOpenAI75.22026-08-23
28GLM-4.6V (106B-A12B)Z.ai75.22026-06-05
29Command A+Cohere75.12026-08-23
30Claude 3.7 SonnetAnthropic752026-08-23
31GPT-4.1OpenAI74.82026-08-23
32Claude Sonnet 4Anthropic74.42026-08-23
33Claude Opus 4Anthropic73.72026-06-13
34Qwen3 VL Thinking (8B)Alibaba73.52026-06-05
35Llama 4 MaverickMeta73.42026-08-23
36Qwen3.5 4BAlibaba73.42026-09-03
37Grok 3 BetaSpaceXAI73.22026-07-13
38Gemini 2.5 Flash LiteGoogle72.92026-08-23
39GPT-4.1 miniOpenAI72.72026-08-23
40GPT-4oOpenAI72.22026-08-23
41Claude 3.5 SonnetAnthropic722026-08-23
42InternVL-3.5 (8B)OpenGVLab71.72026-06-05
43GLM-4.6V-Flash (9B)Z.ai71.22026-06-05
44MiMo VL RL 2508 (7B)Xiaomi71.12026-06-05
45Gemini 2.0 Flash ExpGoogle70.62026-06-05
46Qwen2.5 VL 72BAlibaba70.22026-08-23
47Qwen2.5 VL 32B InstructAlibaba702026-08-26
48Grok 3 Mini BetaSpaceXAI69.42026-07-13
49Llama 4 ScoutMeta69.42026-08-23
50MiniMax VL 01MiniMax68.52026-06-05
51Gemini 1.5 ProGoogle68.42026-08-23
52InternVL2.5-78BOpenGVLab66.52026-06-05
53Grok 2SpaceXAI66.12026-08-23
54Gemma 3 27BGoogle64.92026-06-05
55Qwen2 VL 72B InstructAlibaba64.52026-08-25
56Pixtral LargeMistral642026-08-23
57Kimi VL A3B ThinkingMoonshot642026-06-05
58Grok 2 MiniSpaceXAI63.22026-08-23
60Nova ProAmazon61.72026-09-01
61Gemma 3 12BGoogle59.62026-06-05
62GPT-4o miniOpenAI59.42026-08-23
63Qwen2.5 Omni 7BAlibaba59.22026-08-23
64Kimi VL A3B InstructMoonshot572026-06-05
65Nova LiteAmazon56.22026-09-01
66GPT-4.1 nanoOpenAI55.42026-08-23
67Phi 4 Multimodal InstructMicrosoft55.12026-08-23
68Gemini 1.5 Flash 8BGoogle53.72026-08-23
69Phi 3.5 Vision InstructMicrosoft432026-08-23
◆ IV — INDEPENDENTLY VERIFIED · ◆ AA — AGGREGATOR · ◆ VA — VENDOR · ◇ SA — SOURCE-ATTRIBUTED

Variants of this boardSCORING CONFIGS & SPLITS — NOT CITED STANDALONE, SO THEY LIVE HERE

MMMU (val) (Pass@1)

VARIANT38 models · best score per model
#ModelVendorScoreVLast seen
01Qwen3 VL 235B A22B ReasoningAlibaba80.62026-08-23
02Qwen3 VL 235B A22B InstructAlibaba78.72026-08-23
03Qwen3 VL 32B ReasoningAlibaba78.12026-08-23
04Claude Sonnet 4.5Anthropic77.82026-08-23
05Qwen3 VL 32B InstructAlibaba762026-08-23
06Qwen3 VL 30B A3B ReasoningAlibaba762026-08-23
07Qwen3 VL 30B A3B InstructAlibaba74.22026-08-23
08Qwen3 VL Thinking (8B)Alibaba74.12026-08-23
09Qwen3 VL 4B (Reasoning)Alibaba70.82026-08-23
10Qwen3 VL 8B InstructAlibaba69.62026-08-23
11GPT-4oOpenAI69.12026-08-24
12Claude 3.5 SonnetAnthropic68.32026-08-24
13Qwen3 VL 4B InstructAlibaba67.42026-08-23
14Qwen2.5 VL 72BAlibaba65.82026-09-02
15Gemma 3 27BGoogle64.92026-08-23

MMMU DEV_VAL

VARIANT7 models · best score per model
#ModelVendorScoreVLast seen
01Ministral 3 3BMistral50.82026-08-12
02Gemma 4 E2BGoogle47.72026-08-12
03Qwen3.5 2BAlibaba47.42026-08-12
04Phi 3.5 Vision InstructMicrosoft43.22026-08-12
05LFM2.5-VL-1.6BLiquid AI382026-08-12
06Qwen3 VL 2B InstructAlibaba37.92026-08-12
07North-Micro-Vision-InstructCohere32.92026-08-12

MMMU (validation)

VARIANT7 models · best score per model
#ModelVendorScoreVLast seen
01GPT-5.1OpenAI85.42026-07-29
02Claude Opus 4.5Anthropic80.72026-07-29
03GPT-4oOpenAI69.12026-09-07
04Claude 3.5 SonnetAnthropic68.32026-09-07
05Gemini 1.5 ProGoogle62.22026-09-07
06Claude 3 OpusAnthropic59.42026-09-07
07Claude 3 SonnetAnthropic53.12026-09-07

mmmu_pro_with_python

VARIANT5 models · best score per model
#ModelVendorScoreVLast seen
01Gemini 3.1 ProGoogle85.32026-05-03
02GPT-5.4OpenAI82.12026-05-03
03Kimi K2.6Moonshot80.12026-05-03
04Kimi K2.5Moonshot77.72026-05-03
05Claude Opus 4.6Anthropic77.32026-05-03

Other tracked prints

THIN BOARDSunder 5 published models each — listed, never hidden
PrintLeaderScoreModels
MMMU Pro Standard 10Inkling-Small742
MMMU Pro VisionKimi K2.679.42
THE FAMILY BOARD · EVERY PRINT LABELED · EVERY SCORE SOURCE-ATTRIBUTED ON ITS OWN LIVE BOARDAll leaderboardsThe frontier boardModels by vendor