METR RE-Bench (Research Engineering Benchmark) — Distinct METR task suite from HCAST and SWAA.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude Opus 4.6 | Anthropic | 97.4 | 1 | 2026-05-10 |
| 2 | GPT-5.1 Codex Max | OpenAI | 43.3 | 1 | 2026-05-10 |
| 3 | Claude Opus 4.5 | Anthropic | 40 | 1 | 2026-05-10 |
| 4 | GPT-5 | OpenAI | 40 | 1 | 2026-05-10 |
| 5 | GPT-5.2 | OpenAI | 35 | 1 | 2026-05-10 |
| 6 | Gemini 3 Pro | 35 | 1 | 2026-05-10 | |
| 7 | GPT-5.3 Codex | OpenAI | 25 | 1 | 2026-05-10 |
| 8 | Claude 4 Opus | Anthropic | 20 | 1 | 2026-05-10 |
| 9 | Claude 3.5 Sonnet (Old) (Inspect) | Anthropic | 15 | 1 | 2026-05-10 |
| 10 | o3 | OpenAI | 15 | 1 | 2026-05-10 |
| 11 | Claude Opus 4.1 | Anthropic | 15 | 2 | 2026-06-01 |
| 12 | Claude 3.5 Sonnet (New) (Inspect) | Anthropic | 5 | 1 | 2026-05-10 |
| 13 | o1 | OpenAI | 0 | 1 | 2026-05-10 |
| 14 | GPT4 | OpenAI | 0 | 2 | 2026-05-10 |
| 15 | Claude 3 Opus | Anthropic | 0 | 1 | 2026-05-10 |
| 16 | Claude 3.7 Sonnet | Anthropic | 0 | 1 | 2026-05-10 |
| 17 | GPT-4o | OpenAI | 0 | 1 | 2026-05-10 |
| 18 | GPT-4 Turbo | OpenAI | 0 | 1 | 2026-05-10 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.