Skip to content
VECTOR WIREAI INTELLIGENCE
UTC

AgentWorldBench - Android leaderboard — the family board.

8 TRACKED VARIANTS · 1 FIRST-CLASS BOARD

One family, 8 tracked prints. Scoring configs and splits of the base board render as sections of this page, each under its own honest label.

● LIVE DATA14 MODELS ON THIS BOARDLEADER CLAUDE OPUS 4.6 AT 61.7

The board — AgentWorldBench - AndroidTOP 14 OF 14 MEASURED · BEST SCORE PER MODEL, DEFAULT VARIANT

#ModelVendorScoreVLast seen
01Claude Opus 4.6Anthropic61.72026-06-24
02Claude Opus 4.8Anthropic61.52026-06-24
03Gemini 3.1 ProGoogle61.42026-06-24
04Qwen AgentWorld 397B A17BAlibaba60.22026-06-24
05GPT-5.4OpenAI602026-06-24
06GLM-5.1Z.ai59.12026-06-24
07Kimi K2.6Moonshot58.92026-06-24
08Qwen AgentWorld 35B A3BAlibaba58.22026-06-24
09Claude Sonnet 4.6Anthropic58.02026-06-24
10Qwen3.6 PlusAlibaba57.62026-06-24
11DeepSeek-V4-ProDeepSeek55.22026-06-24
12Qwen3.5 397B A17BAlibaba54.92026-06-24
13Qwen3.5 35B A3BAlibaba53.22026-06-24
14MiniMax M2.7MiniMax52.42026-06-24
◆ IV — INDEPENDENTLY VERIFIED · ◆ AA — AGGREGATOR · ◆ VA — VENDOR · ◇ SA — SOURCE-ATTRIBUTED

Variants of this boardSCORING CONFIGS & SPLITS — NOT CITED STANDALONE, SO THEY LIVE HERE

AgentWorldBench - MCP

VARIANT14 models · best score per model
#ModelVendorScoreVLast seen
01GPT-5.4OpenAI70.12026-06-24
02Claude Sonnet 4.6Anthropic702026-06-24
03Claude Opus 4.6Anthropic69.92026-06-24
04Qwen3.5 397B A17BAlibaba68.32026-06-24
05Qwen AgentWorld 397B A17BAlibaba68.22026-06-24
06GLM-5.1Z.ai67.62026-06-24
07Kimi K2.6Moonshot65.22026-06-24
08Qwen AgentWorld 35B A3BAlibaba64.82026-06-24
09DeepSeek-V4-ProDeepSeek63.32026-06-24
10Gemini 3.1 ProGoogle59.12026-06-24
11Qwen3.5 35B A3BAlibaba57.92026-06-24
12MiniMax M2.7MiniMax55.82026-06-24
13Qwen3.6 PlusAlibaba55.32026-06-24
14Claude Opus 4.8Anthropic54.92026-06-24

AgentWorldBench - OS

VARIANT14 models · best score per model
#ModelVendorScoreVLast seen
01Claude Opus 4.6Anthropic70.22026-06-24
02GPT-5.4OpenAI68.62026-06-24
03Qwen AgentWorld 397B A17BAlibaba67.92026-06-24
04Gemini 3.1 ProGoogle66.92026-06-24
05Claude Opus 4.8Anthropic66.62026-06-24
06Qwen AgentWorld 35B A3BAlibaba65.92026-06-24
07DeepSeek-V4-ProDeepSeek63.72026-06-24
08Claude Sonnet 4.6Anthropic63.22026-06-24
09Qwen3.5 397B A17BAlibaba60.92026-06-24
10Kimi K2.6Moonshot60.82026-06-24
11Qwen3.6 PlusAlibaba60.32026-06-24
12GLM-5.1Z.ai59.12026-06-24
13MiniMax M2.7MiniMax57.72026-06-24
14Qwen3.5 35B A3BAlibaba56.32026-06-24

AgentWorldBench - Overall

VARIANT14 models · best score per model
#ModelVendorScoreVLast seen
01Qwen AgentWorld 397B A17BAlibaba58.72026-06-24
02GPT-5.4OpenAI58.32026-06-24
03Claude Opus 4.6Anthropic57.82026-06-24
04Claude Opus 4.8Anthropic56.62026-06-24
05Qwen AgentWorld 35B A3BAlibaba56.42026-06-24
06Claude Sonnet 4.6Anthropic56.02026-06-24
07Qwen3.5 397B A17BAlibaba54.72026-06-24
08Gemini 3.1 ProGoogle54.62026-06-24
09Kimi K2.6Moonshot53.42026-06-24
10DeepSeek-V4-ProDeepSeek53.02026-06-24
11GLM-5.1Z.ai51.32026-06-24
12Qwen3.6 PlusAlibaba50.82026-06-24
13Qwen3.5 35B A3BAlibaba47.72026-06-24
14MiniMax M2.7MiniMax46.12026-06-24

AgentWorldBench - SWE

VARIANT14 models · best score per model
#ModelVendorScoreVLast seen
01Qwen AgentWorld 397B A17BAlibaba68.52026-06-24
02GPT-5.4OpenAI66.32026-06-24
03Qwen AgentWorld 35B A3BAlibaba65.62026-06-24
04Claude Opus 4.6Anthropic64.52026-06-24
05Claude Sonnet 4.6Anthropic64.52026-06-24
06Qwen3.5 397B A17BAlibaba64.42026-06-24
07Claude Opus 4.8Anthropic64.12026-06-24
08DeepSeek-V4-ProDeepSeek59.42026-06-24
09Qwen3.6 PlusAlibaba59.12026-06-24
10Gemini 3.1 ProGoogle59.12026-06-24
11Kimi K2.6Moonshot58.82026-06-24
12GLM-5.1Z.ai52.12026-06-24
13Qwen3.5 35B A3BAlibaba47.62026-06-24
14MiniMax M2.7MiniMax37.42026-06-24

AgentWorldBench - Terminal

VARIANT14 models · best score per model
#ModelVendorScoreVLast seen
01Claude Opus 4.8Anthropic59.22026-06-24
02Qwen AgentWorld 397B A17BAlibaba57.72026-06-24
03Claude Opus 4.6Anthropic57.52026-06-24
04Claude Sonnet 4.6Anthropic57.02026-06-24
05Qwen3.5 397B A17BAlibaba55.32026-06-24
06Qwen AgentWorld 35B A3BAlibaba54.02026-06-24
07GPT-5.4OpenAI53.72026-06-24
08Kimi K2.6Moonshot52.52026-06-24
09Gemini 3.1 ProGoogle52.52026-06-24
10DeepSeek-V4-ProDeepSeek51.32026-06-24
11Qwen3.6 PlusAlibaba50.62026-06-24
12GLM-5.1Z.ai47.32026-06-24
13Qwen3.5 35B A3BAlibaba46.12026-06-24
14MiniMax M2.7MiniMax41.62026-06-24

AgentWorldBench - Web

VARIANT14 models · best score per model
#ModelVendorScoreVLast seen
01Claude Opus 4.8Anthropic54.72026-06-24
02Gemini 3.1 ProGoogle52.82026-06-24
03GPT-5.4OpenAI51.82026-06-24
04GLM-5.1Z.ai51.52026-06-24
05Claude Opus 4.6Anthropic51.42026-06-24
06Qwen AgentWorld 397B A17BAlibaba51.02026-06-24
07Qwen3.6 PlusAlibaba50.82026-06-24
08Claude Sonnet 4.6Anthropic50.82026-06-24
09MiniMax M2.7MiniMax50.52026-06-24
10DeepSeek-V4-ProDeepSeek50.32026-06-24
11Kimi K2.6Moonshot50.22026-06-24
12Qwen AgentWorld 35B A3BAlibaba49.52026-06-24
13Qwen3.5 397B A17BAlibaba48.52026-06-24
14Qwen3.5 35B A3BAlibaba47.12026-06-24
THE FAMILY BOARD · EVERY PRINT LABELED · EVERY SCORE SOURCE-ATTRIBUTED ON ITS OWN LIVE BOARDAll leaderboardsThe frontier boardModels by vendor