IFEval — Same metric as 'IFEval strict-prompt', matching median (84.3) - same axis, diff formatting.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Gemma 4 26B A4B | 96.4 | 1 | 2026-05-02 | |
| 2 | Qwen3.5 27B | Alibaba | 95 | 1 | 2026-08-23 |
| 3 | Qwen3.7 Plus Preview | Alibaba | 94.6 | 1 | 2026-08-23 |
| 4 | Qwen3.6 Plus | Alibaba | 94.3 | 1 | 2026-08-23 |
| 5 | Qwen3.7 Max | Alibaba | 94.3 | 1 | 2026-08-23 |
| 6 | o3-mini | OpenAI | 93.9 | 1 | 2026-08-23 |
| 7 | Qwen3.5 122B A10B | Alibaba | 93.4 | 1 | 2026-08-23 |
| 8 | Claude 3.7 Sonnet | Anthropic | 93.2 | 1 | 2026-08-23 |
| 9 | Qwen3.5 397B A17B | Alibaba | 92.6 | 1 | 2026-08-23 |
| 10 | Llama 3.3 70B Instruct | Meta | 92.1 | 2 | 2026-08-23 |
| 11 | Nova Pro (Non-Reasoning) | Amazon | 92.1 | 1 | 2026-08-23 |
| 12 | Qwen3.5 35B A3B | Alibaba | 91.9 | 1 | 2026-08-23 |
| 13 | LFM2.5-8B-A1B | Liquid AI | 91.8 | 1 | 2026-08-09 |
| 14 | Qwen3.5 9B | Alibaba | 91.5 | 1 | 2026-08-23 |
| 15 | Gemma 4 26B A4B IT | 91.4 | 1 | 2026-08-09 | |
| 16 | Qwen3 30B A3B | Alibaba | 90.8 | 2 | 2026-08-09 |
| 17 | Gemma 3 27B | 90.4 | 2 | 2026-08-23 | |
| 18 | NVIDIA Nemotron Nano 9B V2 | NVIDIA | 90.3 | 1 | 2026-08-23 |
| 19 | Gemma 3 4B | 90.2 | 2 | 2026-08-23 | |
| 20 | Claude 3.5 Sonnet | Anthropic | 90.1 | 12 | 2026-06-12 |
| 21 | Qwen3.5 4B | Alibaba | 89.8 | 2 | 2026-08-23 |
| 22 | Kimi K2 Instruct | Moonshot | 89.8 | 4 | 2026-08-23 |
| 23 | Nova Lite (Non-Reasoning) | Amazon | 89.7 | 1 | 2026-08-23 |
| 24 | Llama 3.1 Nemotron Ultra 253B V1 | NVIDIA | 89.5 | 1 | 2026-08-23 |
| 25 | Gemini 1.5 Pro | 89.4 | 1 | 2026-06-12 | |
| 26 | MiniMax Text 01 | MiniMax | 89.1 | 1 | 2026-06-12 |
| 27 | Qwen3 Next 80B A3B | Alibaba | 88.9 | 1 | 2026-08-23 |
| 28 | Gemma 3 12B | 88.9 | 1 | 2026-08-23 | |
| 29 | Qwen3 235B A22B Instruct 2507 | Alibaba | 88.7 | 1 | 2026-08-23 |
| 30 | Llama 3.1 Instruct 405B | Meta | 88.6 | 4 | 2026-08-23 |
| 31 | lfm-2.5-1.2b-thinking:free | Liquid AI | 88.4 | 1 | 2026-08-09 |
| 32 | Gemini 2.0 Flash Exp | 88.4 | 1 | 2026-06-12 | |
| 33 | Qwen3 32B | Alibaba | 88.4 | 1 | 2026-06-15 |
| 34 | GPT-4.5 Preview | OpenAI | 88.2 | 1 | 2026-08-23 |
| 35 | Qwen3 VL 235B A22B Reasoning | Alibaba | 88.2 | 1 | 2026-08-23 |
| 36 | Qwen3 VL 235B A22B Instruct | Alibaba | 87.8 | 1 | 2026-08-23 |
| 37 | Qwen3 VL 32B Reasoning | Alibaba | 87.8 | 1 | 2026-08-23 |
| 38 | Gemma 4 E4B | 87.7 | 1 | 2026-08-09 | |
| 39 | Claude Sonnet 4 | Anthropic | 87.6 | 2 | 2026-06-15 |
| 40 | Qwen3 Next 80B A3B Instruct | Alibaba | 87.6 | 1 | 2026-08-23 |
| 41 | Llama 3.1 70B Instruct | Meta | 87.5 | 3 | 2026-08-23 |
| 42 | Claude 4 Opus | Anthropic | 87.4 | 2 | 2026-06-15 |
| 43 | GPT-4.1 | OpenAI | 87.4 | 1 | 2026-08-23 |
| 44 | DeepSeek-V3 | DeepSeek | 87.3 | 10 | 2026-08-23 |
| 45 | Nova Micro (Non-Reasoning) | Amazon | 87.2 | 1 | 2026-08-23 |
| 46 | Qwen2.5 Instruct 72B | Alibaba | 87.2 | 3 | 2026-08-23 |
| 47 | gpt-oss-20b | OpenAI | 86.7 | 1 | 2026-08-09 |
| 48 | Qwen3 VL 30B A3B Instruct | Alibaba | 85.8 | 1 | 2026-08-23 |
| 49 | Seed Oss 36B Instruct | ByteDance | 85.8 | 1 | 2026-06-15 |
| 50 | Hunyuan Large Inst. | Tencent | 85 | 1 | 2026-05-31 |
| 51 | Phi 4 Reasoning Plus | Microsoft | 84.9 | 1 | 2026-08-23 |
| 52 | Sarvam 105B | Sarvam AI | 84.8 | 1 | 2026-08-23 |
| 53 | OpenAI o1-mini | OpenAI | 84.8 | 10 | 2026-06-05 |
| 54 | Qwen3 VL 32B Instruct | Alibaba | 84.7 | 1 | 2026-08-23 |
| 55 | GPT-4o | OpenAI | 84.3 | 13 | 2026-08-23 |
| 56 | GPT-4.1 mini | OpenAI | 84.1 | 1 | 2026-08-23 |
| 57 | QwQ 32B Preview | Alibaba | 83.9 | 6 | 2026-08-23 |
| 58 | Qwen3 VL 8B Instruct | Alibaba | 83.7 | 1 | 2026-08-23 |
| 59 | DeepSeek-R1 | DeepSeek | 83.3 | 6 | 2026-06-04 |
| 60 | Qwen3 235B A22B | Alibaba | 83.2 | 2 | 2026-06-15 |
| 61 | Qwen3 VL Thinking (8B) | Alibaba | 83.2 | 1 | 2026-08-23 |
| 62 | Gemma 4 E2B | 82.9 | 1 | 2026-08-09 | |
| 63 | Qwen3 VL 4B (Reasoning) | Alibaba | 82.6 | 1 | 2026-08-23 |
| 64 | Qwen3 VL 4B Instruct | Alibaba | 82.3 | 1 | 2026-08-23 |
| 65 | LFM2.5-VL-3B | Liquid AI | 82.3 | 2 | 2026-08-23 |
| 66 | Granite 4.0 H Tiny | IBM | 82.2 | 1 | 2026-08-09 |
| 67 | Qwen3 VL 30B A3B Reasoning | Alibaba | 81.7 | 1 | 2026-08-23 |
| 68 | DeepSeek-V2.5 | DeepSeek | 80.6 | 1 | 2026-05-03 |
| 69 | Llama 3.1 8B Instruct | Meta | 80.4 | 2 | 2026-08-23 |
| 70 | Gemma 3 1B | 80.2 | 1 | 2026-08-23 | |
| 71 | Granite 4.0 H 1B | IBM | 80.1 | 1 | 2026-08-09 |
| 72 | Granite 4.0 1B | IBM | 79.6 | 2 | 2026-08-09 |
| 73 | LFM2 2.6B | Liquid AI | 79.6 | 1 | 2026-08-09 |
| 74 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 79.3 | 1 | 2026-08-23 |
| 75 | Qwen3.5 2B | Alibaba | 78.6 | 2 | 2026-08-23 |
| 76 | R1-Distill-Qwen-14B | Alibaba | 78.3 | 5 | 2026-06-05 |
| 77 | Llama 3.2 3B Instruct | Meta | 77.4 | 2 | 2026-08-23 |
| 78 | LFM2.5-350M | Liquid AI | 77 | 2 | 2026-08-09 |
| 79 | North-Micro-Vision-Instruct | Cohere | 74.9 | 1 | 2026-08-23 |
| 80 | LFM2 1.2B | Liquid AI | 74.9 | 1 | 2026-08-09 |
| 81 | Granite 3.3 8B Instruct | IBM | 74.8 | 2 | 2026-08-23 |
| 82 | GPT-4.1 nano | OpenAI | 74.5 | 1 | 2026-08-23 |
| 83 | Granite 3.2 8B Instruct | IBM | 74.3 | 1 | 2026-06-11 |
| 84 | Qwen3 1.7B | Alibaba | 74 | 2 | 2026-08-09 |
| 85 | Qwen3 1.7B (instruct) | Alibaba | 73.7 | 2 | 2026-08-09 |
| 86 | LFM2-700M | Liquid AI | 72.2 | 1 | 2026-08-09 |
| 87 | LFM2.5-230M | Liquid AI | 71.7 | 1 | 2026-08-09 |
| 88 | Qwen3.5 0.8B | Alibaba | 71.2 | 3 | 2026-08-23 |
| 89 | Granite 3.3 2B Instruct | IBM | 65.8 | 1 | 2026-06-11 |
| 90 | LFM2-350M | Liquid AI | 65.1 | 3 | 2026-08-09 |
| 91 | Qwen3 0.6B | Alibaba | 64.2 | 1 | 2026-08-09 |
| 92 | Granite 3.1 2B Instruct | IBM | 63.6 | 1 | 2026-06-11 |
| 93 | Gemma 3 1B IT | 63.5 | 5 | 2026-08-09 | |
| 94 | Phi 4 | Microsoft | 63 | 1 | 2026-08-23 |
| 95 | Granite 3.2 2B Instruct | IBM | 61.5 | 1 | 2026-06-11 |
| 96 | LFM2.5-VL-450M-Extract | Liquid AI | 61.2 | 1 | 2026-08-09 |
| 97 | MiMo 7B RL | Xiaomi | 61 | 5 | 2026-06-05 |
| 98 | R1-Distill-Qwen-7B | Alibaba | 60.5 | 5 | 2026-06-05 |
| 99 | Qwen3.5 0.8B (Instruct) | Alibaba | 59.9 | 2 | 2026-08-09 |
| 100 | DeepSeek-V2 | DeepSeek | 57.7 | 1 | 2026-05-03 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.