MultiPL-E — Multi-programming-language code-gen benchmark; unscoped/aggregate reading.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Claude 4 Opus | Anthropic | 89.6 | 2 | 2026-06-15 |
| 2 | Claude Sonnet 4 | Anthropic | 88.6 | 2 | 2026-06-15 |
| 3 | Qwen3 235B A22B Instruct 2507 | Alibaba | 87.9 | 1 | 2026-08-23 |
| 4 | Qwen3 Next 80B A3B Instruct | Alibaba | 87.8 | 1 | 2026-08-23 |
| 5 | GPT-4.1 | OpenAI | 86.7 | 2 | 2026-06-15 |
| 6 | Qwen3 VL 235B A22B Instruct | Alibaba | 86.1 | 1 | 2026-08-23 |
| 7 | Kimi K2 Instruct | Moonshot | 85.7 | 3 | 2026-08-23 |
| 8 | DeepSeek-V3 | DeepSeek | 83.1 | 2 | 2026-06-15 |
| 9 | Qwen3 235B A22B | Alibaba | 78.2 | 3 | 2026-08-23 |
| 10 | Qwen2.5 Instruct 72B | Alibaba | 75.1 | 1 | 2026-08-23 |
| 11 | Stable-DiffCoder-8B-Base | ByteDance | 71.2 | 1 | 2026-06-05 |
| 12 | Qwen2 Instruct (72B) | Alibaba | 69.2 | 1 | 2026-08-23 |
| 13 | Qwen2.5 Omni 7B | Alibaba | 65.8 | 1 | 2026-08-23 |
| 14 | NVIDIA-NemotronLabs-VoiceChat-11B | NVIDIA | 62.5 | 1 | 2026-08-04 |
| 15 | Granite 4.1 30B | IBM | 62.3 | 1 | 2026-06-15 |
| 16 | Granite 4.1 8B | IBM | 60.3 | 1 | 2026-06-15 |
| 17 | Qwen2 7B Instruct | Alibaba | 59.1 | 1 | 2026-08-23 |
| 18 | Qwen2.5 Coder Instruct 7B | Alibaba | 58.8 | 1 | 2026-06-05 |
| 19 | Qwen2.5 7B Base | Alibaba | 48.5 | 1 | 2026-05-03 |
| 20 | DeepSeek-Coder-6.7B-Base | DeepSeek | 44.7 | 1 | 2026-06-05 |
| 21 | Qwen2.5 3B Base | Alibaba | 44 | 1 | 2026-05-03 |
| 22 | Qwen3 4B Base Dense | Alibaba | 36.4 | 1 | 2026-05-03 |
| 23 | Gemma 3 1B Base Dense | 2.2 | 1 | 2026-05-03 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.