VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

OSWorld-Verified

56 models tracked

OSWorld-Verified — the OSWorld team's 2025 corrected revision of the computer-use suite; the current standard track (scores not comparable to original OSWorld). Carries the scored axis.

#ModelVendorBest scoreRunsLast seen
1Qwen3.8 Max PreviewAlibaba86.112026-08-23
2Claude Mythos 5Anthropic85.432026-08-23
3Claude Fable 5Anthropic8542026-08-23
4Kimi K3Moonshot84.812026-07-27
5Qwen3.8 27BAlibaba84.322026-08-24
6Claude Opus 4.8Anthropic83.462026-08-24
7GPT-5.6 SolOpenAI8312026-08-24
8Gemini 3.6 FlashGoogle8362026-08-24
9Claude Opus 4.7Anthropic82.872026-08-23
10Claude Sonnet 5Anthropic81.232026-08-23
11Muse Spark 1.1Meta80.822026-08-23
12GPT-5.5OpenAI78.752026-08-23
13ClaudesAnthropic78.512026-08-12
14Claude Sonnet 4.6Anthropic78.532026-08-23
15Gemini 3.5 Flash CyberGoogle78.412026-08-04
16Gemini 3.5 FlashGoogle78.482026-08-24
17Gemini 3.1 ProGoogle76.242026-07-06
18GPT-5.4OpenAI7542026-08-23
19Gemini 3.5 Flash LiteGoogle7452026-08-24
20Qwen3.7 Plus PreviewAlibaba73.322026-08-24
21Kimi K2.6Moonshot73.122026-08-23
22Claude Opus 4.6Anthropic72.752026-08-24
23GPT-5.6 LunaOpenAI72.612026-07-22
24GPT-5.4 miniOpenAI72.112026-08-23
25MiniMax M3MiniMax70.112026-08-23
26Qwen3 VL 235B A22B InstructAlibaba66.712026-08-23
27Claude Opus 4.5Anthropic66.332026-08-23
28muse-glimmer-30bMeta65.922026-08-24
29Gemini 3 Flash PreviewGoogle65.142026-08-04
30GPT-5.3 CodexOpenAI64.712026-08-23
31Qwen3.6 27BAlibaba63.912026-08-24
32Kimi K2.5Moonshot63.312026-05-03
33Qwen3.6 PlusAlibaba62.512026-08-23
34GLM 5V TurboZ.ai62.312026-08-23
35Claude Sonnet 4.5Anthropic61.432026-08-23
36Qwen3.5 122B A10BAlibaba5812026-08-23
37Qwen3.5 27BAlibaba56.212026-08-23
38Qwen3.5 35B A3BAlibaba54.512026-08-23
39Claude Haiku 4.5Anthropic50.712026-08-23
40Claude Opus 4.1Anthropic44.412026-07-29
41Claude Sonnet 4Anthropic42.212026-08-13
42Qwen3 VL 32B ReasoningAlibaba4112026-08-23
43GPT-5.4 nanoOpenAI3912026-08-23
44Qwen3 VL 235B A22B ReasoningAlibaba38.112026-08-23
45Qwen3 VL 8B InstructAlibaba33.912026-08-23
46Qwen3 VL Thinking (8B)Alibaba33.912026-08-23
47Qwen3 VL 32B InstructAlibaba32.612026-08-23
48Qwen3 VL 4B (Reasoning)Alibaba31.412026-08-23
49Qwen3 VL 30B A3B ReasoningAlibaba30.612026-08-23
50Qwen3 VL 30B A3B InstructAlibaba30.312026-08-23
51Qwen3 VL 4B InstructAlibaba26.212026-08-23
52Qwen2.5 VL 72BAlibaba8.812026-08-23
53Kimi VL A3B InstructMoonshot8.212026-06-12
54Qwen2.5 VL 32BAlibaba5.912026-08-23
55GPT-4oOpenAI512026-06-05
56Opus 5Anthropic412026-07-26

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.