Across 15 models scored on HiL-Bench, Opus 5 leads at 57, ahead of Claude Fable 5 at 56.3. The median tracked score is 35.3, and the field spans 4.3 to 57.
Data as of August 24, 2026| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Opus 5 | Anthropic | 57 | 1 | 2026-08-24 |
| 2 | Claude Fable 5 | Anthropic | 56.3 | 1 | 2026-08-24 |
| 3 | GLM-5.2 Full Open Source | Z.ai | 43.7 | 1 | 2026-08-24 |
| 4 | Claude Opus 4.7 | Anthropic | 41.7 | 1 | 2026-08-24 |
| 5 | GPT-5.5 | OpenAI | 39.7 | 1 | 2026-08-24 |
| 6 | Claude Opus 4.6 | Anthropic | 38.3 | 1 | 2026-08-24 |
| 7 | Gemini 3.1 Pro | 35.3 | 1 | 2026-08-24 | |
| 8 | Claude Opus 4.8 | Anthropic | 35.3 | 1 | 2026-08-24 |
| 9 | GPT-5.6 Sol | OpenAI | 32.3 | 1 | 2026-08-24 |
| 10 | Gemini 3.5 Flash | 27.7 | 1 | 2026-08-24 | |
| 11 | Grok 4.20 | SpaceXAI | 20 | 1 | 2026-08-24 |
| 12 | Kimi K2.6 | Moonshot | 18.7 | 1 | 2026-08-24 |
| 13 | GPT-5.4 | OpenAI | 9.7 | 1 | 2026-08-24 |
| 14 | MiniMax M2.5 | MiniMax | 6.3 | 1 | 2026-08-24 |
| 15 | GPT-5.3 Codex | OpenAI | 4.3 | 1 | 2026-08-24 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.