MRCR v2 (OpenAI long-context needle benchmark) — Explicit v2, 8-needle, 128K context, averaged metric; Google Gemini source.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Gemini 3.7 Flash | 97 | 1 | 2026-08-14 | |
| 2 | GPT-5.6 Terra | OpenAI | 93.5 | 1 | 2026-08-14 |
| 3 | Gemini 3.6 Flash | 91.8 | 1 | 2026-07-22 | |
| 4 | Gemini 3.1 Pro | 84.9 | 3 | 2026-08-24 | |
| 5 | Claude Sonnet 4.6 | Anthropic | 84.9 | 2 | 2026-07-06 |
| 6 | Claude Opus 4.6 | Anthropic | 84 | 1 | 2026-05-01 |
| 7 | GPT-5.2 | OpenAI | 83.8 | 1 | 2026-05-01 |
| 8 | Claude Sonnet 5 | Anthropic | 81.5 | 1 | 2026-07-22 |
| 9 | Grok4.5 | SpaceXAI | 81.4 | 1 | 2026-07-22 |
| 10 | Gemini 3.5 Flash | 77.3 | 2 | 2026-08-24 | |
| 11 | Gemini 3 Pro | 77 | 1 | 2026-05-01 | |
| 12 | GPT-5.6 Luna | OpenAI | 74.8 | 1 | 2026-07-22 |
| 13 | Gemini 3 Flash Preview | 67.2 | 1 | 2026-07-06 | |
| 14 | Gemma 4 31B | 66.4 | 26 | 2026-06-06 | |
| 15 | Claude Opus 4.7 | Anthropic | 59.3 | 2 | 2026-07-06 |
| 16 | Gemma 4 26B A4B | 44.1 | 26 | 2026-06-06 | |
| 17 | Gemma 4 12B | 43.4 | 26 | 2026-07-17 | |
| 18 | Gemma 4 E4B | 25.4 | 31 | 2026-07-11 | |
| 19 | Gemma 4 E2B | 19.1 | 35 | 2026-07-21 | |
| 20 | Gemma 3 27B | 13.5 | 27 | 2026-07-10 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.