DeepSearchQA — DeepSearchQA F1 metric, distinct axis from accuracy metric
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot | 95 | 2 | 2026-08-23 |
| 2 | Claude Fable 5 | Anthropic | 94.2 | 1 | 2026-07-27 |
| 3 | Claude Opus 4.8 | Anthropic | 93.1 | 2 | 2026-08-23 |
| 4 | Kimi K2.6 | Moonshot | 92.5 | 2 | 2026-08-23 |
| 5 | Claude Opus 4.6 | Anthropic | 91.3 | 2 | 2026-08-23 |
| 6 | Hy3-preview | Tencent | 91 | 1 | 2026-08-23 |
| 7 | Kimi K2.5 | Moonshot | 89 | 3 | 2026-08-23 |
| 8 | MiMo V2 Pro | Xiaomi | 86.7 | 1 | 2026-08-23 |
| 9 | Muse Spark 1.1 | Meta | 84.9 | 1 | 2026-07-21 |
| 10 | Gemini 3.1 Pro | 81.9 | 2 | 2026-05-03 | |
| 11 | GPT-5.4 | OpenAI | 78.6 | 1 | 2026-05-03 |
| 12 | Claude Opus 4.5 | Anthropic | 76.1 | 1 | 2026-06-15 |
| 13 | Muse Spark | Meta | 74.8 | 1 | 2026-08-23 |
| 14 | muse-glimmer-30b | Meta | 74.6 | 1 | 2026-08-23 |
| 15 | GPT-5.2 | OpenAI | 71.3 | 1 | 2026-06-15 |
| 16 | Gemini 3 Pro | 63.2 | 1 | 2026-06-15 | |
| 17 | DeepSeek-V3.2 | DeepSeek | 60.9 | 1 | 2026-06-15 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.