HealthBench, Professional subset — Distinct Professional subset; max=525 is a data anomaly, flagged for QA not naming.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Mythos 5 | Anthropic | 66 | 2 | 2026-06-12 |
| 2 | Claude Fable 5 | Anthropic | 66 | 1 | 2026-08-23 |
| 3 | GPT-5.6 Sol | OpenAI | 60.5 | 2 | 2026-08-23 |
| 4 | Opus 5 | Anthropic | 59.8 | 2 | 2026-08-23 |
| 5 | Muse Spark 1.1 | Meta | 59.3 | 1 | 2026-07-21 |
| 6 | Claude Sonnet 5 | Anthropic | 57.8 | 2 | 2026-08-23 |
| 7 | GPT-5.6 Terra | OpenAI | 57.7 | 1 | 2026-08-23 |
| 8 | Claude Opus 4.8 | Anthropic | 57.4 | 3 | 2026-08-23 |
| 9 | GPT-5.6 Luna | OpenAI | 55.7 | 1 | 2026-08-23 |
| 10 | GPT-5.5 | OpenAI | 51.8 | 3 | 2026-08-12 |
| 11 | Claude Sonnet 4.6 | Anthropic | 44.2 | 1 | 2026-06-30 |
| 12 | Claudes | Anthropic | 44.2 | 1 | 2026-08-12 |
| 13 | GPT-5.5 Instant | OpenAI | 38.4 | 1 | 2026-08-23 |
| 14 | MAI-Thinking-1 | Microsoft | 35 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.