LiveBench, Instruction Following category — Distinct LiveBench category from Coding/Language.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Gemini 3.7 Flash | 79.9 | 1 | 2026-08-23 | |
| 2 | Gemini 3.1 Pro | 79.1 | 1 | 2026-08-23 | |
| 3 | Claude Fable 5 | Anthropic | 75.8 | 1 | 2026-08-23 |
| 4 | Gemini 3.5 Flash | 75.6 | 1 | 2026-08-23 | |
| 5 | Gemini 3.6 Flash | 75.4 | 1 | 2026-08-23 | |
| 6 | Muse Spark 1.2 | Meta | 74.3 | 1 | 2026-08-23 |
| 7 | Qwen3.8 Max Preview | Alibaba | 74.1 | 1 | 2026-08-23 |
| 8 | Qwen3.7 Max | Alibaba | 74 | 1 | 2026-08-23 |
| 9 | Qwen3.8 27B | Alibaba | 72.7 | 1 | 2026-08-23 |
| 10 | Claude Opus 4.8 | Anthropic | 72 | 1 | 2026-08-23 |
| 11 | Grok 4.6 | SpaceXAI | 71.9 | 1 | 2026-08-23 |
| 12 | GPT-5.6 Sol | OpenAI | 71.8 | 1 | 2026-08-23 |
| 13 | Grok4.5 | SpaceXAI | 71.5 | 1 | 2026-08-23 |
| 14 | Kimi K3 | Moonshot | 71.4 | 1 | 2026-08-23 |
| 15 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek | 71 | 1 | 2026-08-23 |
| 16 | GPT-5.5 | OpenAI | 70.7 | 1 | 2026-08-23 |
| 17 | GPT-5.4 | OpenAI | 70.2 | 1 | 2026-08-23 |
| 18 | Inkling | Thinking Machines | 70.1 | 1 | 2026-08-23 |
| 19 | Muse Spark 1.1 | Meta | 69.6 | 1 | 2026-08-23 |
| 20 | Gemini 3.5 Flash Lite | 67.2 | 1 | 2026-08-23 | |
| 21 | GPT-5.4 nano | OpenAI | 67.2 | 1 | 2026-08-23 |
| 22 | Claude Opus 4.7 | Anthropic | 66.7 | 1 | 2026-08-23 |
| 23 | GPT-5.2 Codex | OpenAI | 66.5 | 1 | 2026-08-23 |
| 24 | DeepSeek-V4-Flash | DeepSeek | 65.5 | 2 | 2026-08-23 |
| 25 | Grok Build 0.1 | SpaceXAI | 65.2 | 1 | 2026-08-23 |
| 26 | GPT-5.6 Terra | OpenAI | 64.6 | 1 | 2026-08-23 |
| 27 | Kimi K2.6 | Moonshot | 64.4 | 1 | 2026-08-23 |
| 28 | Claude Sonnet 5 | Anthropic | 63.9 | 1 | 2026-08-23 |
| 29 | Opus 5 | Anthropic | 63.8 | 1 | 2026-08-23 |
| 30 | Claude Opus 4.6 | Anthropic | 63.3 | 1 | 2026-08-23 |
| 31 | Claude Sonnet 4.6 | Anthropic | 63.2 | 1 | 2026-08-23 |
| 32 | Grok 4.3 | SpaceXAI | 62.8 | 1 | 2026-08-23 |
| 33 | Claude Opus 4.5 | Anthropic | 62.5 | 1 | 2026-08-23 |
| 34 | DeepSeek-V4-Pro | DeepSeek | 62.4 | 1 | 2026-08-23 |
| 35 | GLM-5.2 Full Open Source | Z.ai | 62.3 | 1 | 2026-08-23 |
| 36 | GPT-5.2 | OpenAI | 61.8 | 1 | 2026-08-23 |
| 37 | ox-alpha-max | Stealth | 60.3 | 1 | 2026-08-23 |
| 38 | GPT-5.6 Luna | OpenAI | 60.1 | 1 | 2026-08-23 |
| 39 | GPT-5.4 mini | OpenAI | 59.8 | 1 | 2026-08-23 |
| 40 | Qwen3.6 Plus | Alibaba | 58.3 | 1 | 2026-08-23 |
| 41 | MiniMax M3 | MiniMax | 57.5 | 1 | 2026-08-23 |
| 42 | Kimi K2.7 Code | Moonshot | 56.3 | 1 | 2026-08-23 |
| 43 | Qwen3.6 27B | Alibaba | 53.2 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.