METR HCAST (Human-Calibrated Autonomy Software Tasks) — METR time-horizon task suite component; distinct from metr_re_bench and metr_swaa.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 77 | 1 | 2026-05-10 |
| 2 | GPT-5.2 | OpenAI | 77 | 1 | 2026-05-10 |
| 3 | GPT-5.3 Codex | OpenAI | 75.6 | 1 | 2026-05-10 |
| 4 | Claude Opus 4.5 | Anthropic | 73.4 | 1 | 2026-05-10 |
| 5 | GPT-5.1 Codex Max | OpenAI | 71.5 | 1 | 2026-05-10 |
| 6 | Gemini 3 Pro | 71.3 | 1 | 2026-05-10 | |
| 7 | GPT-5 | OpenAI | 68.4 | 1 | 2026-05-10 |
| 8 | o3 | OpenAI | 64.7 | 1 | 2026-05-10 |
| 9 | Claude 4 Opus | Anthropic | 61.7 | 1 | 2026-05-10 |
| 10 | Claude Opus 4.1 | Anthropic | 60.6 | 2 | 2026-06-01 |
| 11 | Claude 3.7 Sonnet | Anthropic | 54.2 | 1 | 2026-05-10 |
| 12 | o1 | OpenAI | 42.6 | 1 | 2026-05-10 |
| 13 | Claude 3.5 Sonnet (New) (Inspect) | Anthropic | 40.7 | 1 | 2026-05-10 |
| 14 | Claude 3.5 Sonnet (Old) (Inspect) | Anthropic | 32.6 | 1 | 2026-05-10 |
| 15 | GPT-4o | OpenAI | 25 | 1 | 2026-05-10 |
| 16 | Claude 3 Opus | Anthropic | 20.6 | 1 | 2026-05-10 |
| 17 | GPT4 | OpenAI | 19.7 | 2 | 2026-05-10 |
| 18 | GPT-4 Turbo | OpenAI | 16.7 | 1 | 2026-05-10 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.