Skip to content
VECTOR WIREAI INTELLIGENCE
UTC

HealthBench leaderboard — the family board.

9 TRACKED VARIANTS · 2 FIRST-CLASS BOARDS

One family, 9 tracked prints: HealthBench Professional is cited standalone and keeps live board of its own. Scoring configs and splits of the base board render as sections of this page, each under its own honest label.

● LIVE DATA21 MODELS ON THIS BOARDLEADER GPT-5 AT 67.2

First-class boards in this familyCITED STANDALONE · EACH KEEPS ITS OWN LIVE BOARD

#BoardModels scored
02HealthBenchTHIS PAGE21

The board — HealthBenchTOP 21 OF 21 MEASURED · BEST SCORE PER MODEL, DEFAULT VARIANT

#ModelVendorScoreVLast seen
01GPT-5OpenAI67.22026-05-15
02Sonnet 5.5Anthropic65.42026-09-29
03Claude Mythos 5Anthropic62.72026-06-10
04Haiku 5.5Anthropic61.62026-10-08
05Claude Mythos PreviewAnthropic61.12026-06-12
06Claude Opus 5.5Anthropic60.62026-09-23
07Qwen3.8 Max PreviewAlibaba60.22026-08-23
08Claude Opus 4.8Anthropic59.32026-08-12
09GPT-6.1 SolOpenAI58.52026-09-30
10Kimi K2 ThinkingMoonshot582026-05-15
11gpt-oss-120bOpenAI57.62026-08-23
12GPT-5.6 SolOpenAI572026-08-23
13GPT-5.6 TerraOpenAI572026-08-23
14GPT-5.5OpenAI56.52026-06-12
15GPT-5.6 LunaOpenAI55.82026-08-23
16Qwen3.7 MaxAlibaba54.52026-08-12
17GPT-5.5 InstantOpenAI51.42026-08-23
18DeepSeek-V3.2DeepSeek46.92026-05-15
19Claude Sonnet 4.5Anthropic44.22026-05-15
20Kimi K2 InstructMoonshot43.82026-05-15
21gpt-oss-20bOpenAI42.52026-08-23
◆ IV — INDEPENDENTLY VERIFIED · ◆ AA — AGGREGATOR · ◆ VA — VENDOR · ◇ SA — SOURCE-ATTRIBUTED

Variants of this boardSCORING CONFIGS & SPLITS — NOT CITED STANDALONE, SO THEY LIVE HERE

HealthBench Professional length-adjusted

VARIANT17 models · best score per model
#ModelVendorScoreVLast seen
01Sonnet 5.5Anthropic69.22026-10-07
02Haiku 5.5Anthropic64.82026-10-07
03GPT-6 AstraOpenAI64.72026-09-29
04GPT-6.1 SolOpenAI64.22026-09-29
05Claude Fable 5.1Anthropic62.12026-09-01
06GPT-6 LunaOpenAI60.82026-09-29
07GPT-6 SolOpenAI60.82026-09-29
08GPT-5.6 SolOpenAI60.52026-09-29
09Claude Opus 5Anthropic59.82026-07-24
10GPT-5.6 TerraOpenAI57.72026-09-29
11GPT-5.6 LunaOpenAI55.72026-09-29
12GPT-5.5OpenAI51.82026-09-29
13GPT-5.4OpenAI48.12026-07-09
14GPT-5OpenAI46.22026-07-09
15GPT-5.2OpenAI45.92026-07-09

HealthBench length-adjusted

VARIANT14 models · best score per model
#ModelVendorScoreVLast seen
01Claude Opus 5.5Anthropic60.62026-09-22
02Claude Fable 5.1Anthropic602026-09-01
03GPT-6 AstraOpenAI58.32026-09-29
04Claude Opus 5Anthropic57.82026-07-24
05GPT-5OpenAI57.72026-07-09
06GPT-5.6 TerraOpenAI572026-09-29
07GPT-5.6 SolOpenAI572026-09-29
08GPT-5.2OpenAI56.82026-07-09
09GPT-5.5OpenAI56.52026-09-10
10GPT-5.6 LunaOpenAI55.82026-09-29
11GPT-6 LunaOpenAI54.52026-09-29
12GPT-5.4OpenAI542026-07-09
13GPT-6 SolOpenAI53.22026-09-29
14GPT-5.1OpenAI50.92026-07-09

HealthBench Consensus length-adjusted

VARIANT12 models · best score per model
#ModelVendorScoreVLast seen
01GPT-5.4OpenAI96.32026-07-09
02GPT-6 SolOpenAI96.22026-09-29
03GPT-6.1 SolOpenAI962026-09-29
04GPT-6 LunaOpenAI95.92026-09-29
05GPT-6 AstraOpenAI95.82026-09-29
06GPT-5.5OpenAI95.62026-09-29
07GPT-5OpenAI95.62026-07-09
08GPT-5.6 SolOpenAI95.52026-09-29
09GPT-5.6 TerraOpenAI95.12026-09-29
10GPT-5.6 LunaOpenAI95.12026-09-29
11GPT-5.1OpenAI952026-07-09
12GPT-5.2OpenAI94.42026-07-09

HealthBench Hard length-adjusted

VARIANT12 models · best score per model
#ModelVendorScoreVLast seen
01GPT-6 AstraOpenAI36.62026-09-29
02GPT-6.1 SolOpenAI36.22026-09-29
03GPT-5OpenAI34.72026-07-09
04GPT-5.2OpenAI34.32026-07-09
05GPT-5.6 SolOpenAI33.12026-09-29
06GPT-5.6 TerraOpenAI32.72026-09-29
07GPT-5.6 LunaOpenAI322026-09-29
08GPT-5.5OpenAI31.52026-07-09
09GPT-6 LunaOpenAI31.42026-09-29
10GPT-6 SolOpenAI30.12026-09-29
11GPT-5.4OpenAI29.12026-07-09
12GPT-5.1OpenAI25.42026-07-09

HealthBench Professional (raw)

VARIANT6 models · best score per model
#ModelVendorScoreVLast seen
01Claude Fable 5.1Anthropic74.22026-09-01
02Claude Opus 5Anthropic73.42026-09-01
03Claude Mythos 5Anthropic70.32026-07-24
04Claude Fable 5Anthropic68.92026-09-01
05Claude Sonnet 5Anthropic62.42026-09-01
06Claude Opus 4.8Anthropic60.32026-07-24

HealthBench (raw)

VARIANT6 models · best score per model
#ModelVendorScoreVLast seen
01Claude Opus 5Anthropic67.12026-09-01
02Claude Fable 5.1Anthropic66.72026-09-01
03Claude Mythos 5Anthropic62.52026-07-24
04Claude Fable 5Anthropic61.22026-09-01
05Claude Sonnet 5Anthropic59.22026-09-01
06Claude Opus 4.8Anthropic58.82026-07-24

HealthBench no tools

VARIANT5 models · best score per model
#ModelVendorScoreVLast seen
01GPT-5OpenAI67.22026-06-12
02Kimi K2 ThinkingMoonshot582026-06-12
03DeepSeek-V3.2DeepSeek46.92026-06-12
04Claude Sonnet 4.5Anthropic44.22026-06-12
05Kimi K2 InstructMoonshot43.82026-06-12
THE FAMILY BOARD · EVERY PRINT LABELED · EVERY SCORE SOURCE-ATTRIBUTED ON ITS OWN LIVE BOARDAll leaderboardsThe frontier boardModels by vendor