ITBench SRE (site-reliability-engineering agentic benchmark) — Real AA-measured agentic benchmark for SRE tasks.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 56.2 | 1 | 2026-07-10 |
| 2 | GPT-5.6 Terra | OpenAI | 51 | 1 | 2026-07-10 |
| 3 | Kimi K3 | Moonshot | 47.7 | 2 | 2026-07-31 |
| 4 | Claude Opus 4.7 | Anthropic | 46.7 | 1 | 2026-06-01 |
| 5 | GPT-5.5 | OpenAI | 45.8 | 1 | 2026-06-01 |
| 6 | GLM-5.2 Full Open Source | Z.ai | 42.7 | 1 | 2026-06-24 |
| 7 | Qwen3.7 Max | Alibaba | 42.5 | 1 | 2026-06-01 |
| 8 | Gemini 3.5 Flash | 40.3 | 1 | 2026-06-01 | |
| 9 | GPT-5.6 Luna | OpenAI | 40.3 | 1 | 2026-07-10 |
| 10 | GLM-5.1 | Z.ai | 40.3 | 1 | 2026-06-01 |
| 11 | Claude Sonnet 4.6 | Anthropic | 39.8 | 1 | 2026-06-01 |
| 12 | DeepSeek-V4-Pro | DeepSeek | 38.3 | 1 | 2026-06-29 |
| 13 | MiMo V2.5 Pro | Xiaomi | 38.2 | 2 | 2026-07-07 |
| 14 | Gemma 4 31B | 37.3 | 1 | 2026-06-01 | |
| 15 | Qwen3.5 27B | Alibaba | 35.5 | 1 | 2026-06-01 |
| 16 | GPT-5.4 mini | OpenAI | 35.2 | 2 | 2026-06-14 |
| 17 | GPT-5.4 | OpenAI | 34.5 | 2 | 2026-06-01 |
| 18 | Qwen3.5 397B A17B | Alibaba | 34.1 | 1 | 2026-06-01 |
| 19 | Grok 4.3 | SpaceXAI | 32.7 | 1 | 2026-06-01 |
| 20 | DeepSeek-V4-Flash | DeepSeek | 31.5 | 1 | 2026-06-01 |
| 21 | Kimi K2.6 | Moonshot | 31.2 | 2 | 2026-07-07 |
| 22 | Gemini 3.1 Pro | 30.3 | 2 | 2026-07-07 | |
| 23 | Step 3.7 Flash | StepFun | 30.3 | 2 | 2026-07-07 |
| 24 | Claude Haiku 4.5 | Anthropic | 27.3 | 1 | 2026-06-01 |
| 25 | MiniMax M2.7 | MiniMax | 26.5 | 2 | 2026-07-07 |
| 26 | GPT-5.4 nano | OpenAI | 24.4 | 2 | 2026-07-11 |
| 27 | Gemma 4 26B A4B | 23.6 | 1 | 2026-06-01 | |
| 28 | Qwen3.5 35B A3B | Alibaba | 21.5 | 1 | 2026-06-01 |
| 29 | Grok 4.1 Fast | SpaceXAI | 17.9 | 1 | 2026-06-14 |
| 30 | Muse Spark | Meta | 16.2 | 1 | 2026-06-14 |
| 31 | GPT OSS 120B | OpenAI | 5.6 | 1 | 2026-06-14 |
| 32 | Nemotron 3 Super 120B A12B | NVIDIA | 1.1 | 1 | 2026-06-14 |
| 33 | Llama 3.3 70B Instruct | Meta | 0.6 | 2 | 2026-07-07 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.