METR SWAA (Software Automation/Agentic tasks) — Distinct METR task suite; near-ceiling scores (97.5-100) consistent w/ easier task set.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | o1 | OpenAI | 100 | 1 | 2026-05-10 |
| 2 | GPT-5 | OpenAI | 100 | 1 | 2026-05-10 |
| 3 | Claude 3.5 Sonnet (Old) (Inspect) | Anthropic | 100 | 1 | 2026-05-10 |
| 4 | GPT-5.1 Codex Max | OpenAI | 100 | 1 | 2026-05-10 |
| 5 | Claude Opus 4.1 | Anthropic | 100 | 2 | 2026-06-01 |
| 6 | Claude 4 Opus | Anthropic | 99.8 | 1 | 2026-05-10 |
| 7 | o3 | OpenAI | 99.8 | 1 | 2026-05-10 |
| 8 | GPT-5.2 | OpenAI | 99.6 | 1 | 2026-05-10 |
| 9 | Gemini 3 Pro | 99.5 | 1 | 2026-05-10 | |
| 10 | GPT-5.3 Codex | OpenAI | 99.5 | 1 | 2026-05-10 |
| 11 | Claude Opus 4.5 | Anthropic | 99.5 | 1 | 2026-05-10 |
| 12 | GPT-4 Turbo | OpenAI | 99.5 | 1 | 2026-05-10 |
| 13 | GPT-4o | OpenAI | 99.2 | 1 | 2026-05-10 |
| 14 | Claude 3.5 Sonnet (New) (Inspect) | Anthropic | 98.7 | 1 | 2026-05-10 |
| 15 | Claude 3.7 Sonnet | Anthropic | 98.7 | 1 | 2026-05-10 |
| 16 | Claude Opus 4.6 | Anthropic | 98.5 | 1 | 2026-05-10 |
| 17 | GPT4 | OpenAI | 98.5 | 2 | 2026-05-10 |
| 18 | Claude 3 Opus | Anthropic | 98.5 | 1 | 2026-05-10 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.