Vals.ai/Harvey Legal Agent Benchmark — Single-model umbrella entry w/o Full-Public/Harvey qualifier; subset unclear, kept separate.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Opus 5 | Anthropic | 23 | 2 | 2026-08-23 |
| 2 | Claude Fable 5 | Anthropic | 13.3 | 1 | 2026-08-23 |
| 3 | Claude Opus 4.8 | Anthropic | 10 | 1 | 2026-06-18 |
| 4 | Claude Opus 4.7 | Anthropic | 7.1 | 1 | 2026-08-23 |
| 5 | Claude Sonnet 5 | Anthropic | 5.8 | 1 | 2026-08-23 |
| 6 | Claude Sonnet 4.6 | Anthropic | 5.4 | 1 | 2026-08-23 |
| 7 | Claude Opus 4.6 | Anthropic | 4.2 | 1 | 2026-08-23 |
| 8 | GPT-5.5 | OpenAI | 2.1 | 1 | 2026-08-23 |
| 9 | Gemini 3.5 Flash | 0.8 | 1 | 2026-08-23 | |
| 10 | GPT-5.4 | OpenAI | 0.4 | 1 | 2026-08-23 |
| 11 | Gemini 3.1 Flash Lite Preview | 0 | 1 | 2026-08-23 | |
| 12 | Gemini 3.1 Pro | 0 | 1 | 2026-08-23 | |
| 13 | Gemini 3 Flash Preview | 0 | 1 | 2026-08-23 | |
| 14 | GPT-5.4 mini | OpenAI | 0 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.