Aider Polyglot — Well-known cross-language coding benchmark from the Aider project
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | GPT-5 | OpenAI | 88 | 4 | 2026-08-23 |
| 2 | o3-pro | OpenAI | 84.9 | 1 | 2026-05-01 |
| 3 | Gemini 2.5 Pro | 82.2 | 4 | 2026-08-23 | |
| 4 | Gemini 2.5 Pro Preview 06.05 (32k think) | 82.2 | 2 | 2026-08-24 | |
| 5 | o3 | OpenAI | 81.3 | 2 | 2026-08-23 |
| 6 | Grok 4 | SpaceXAI | 79.6 | 1 | 2026-05-01 |
| 7 | DeepSeek-V3.1 | DeepSeek | 76.3 | 3 | 2026-08-23 |
| 8 | DeepSeek-V3.2-Exp | DeepSeek | 74.5 | 3 | 2026-08-23 |
| 9 | o4-mini | OpenAI | 72 | 2 | 2026-08-23 |
| 10 | DeepSeek-R1 | DeepSeek | 71.6 | 15 | 2026-08-23 |
| 11 | Claude Sonnet 4 | Anthropic | 70.7 | 3 | 2026-06-15 |
| 12 | Claude 4 Opus | Anthropic | 70.7 | 3 | 2026-06-15 |
| 13 | o3-mini | OpenAI | 66.7 | 3 | 2026-08-23 |
| 14 | Claude 3.7 Sonnet | Anthropic | 64.9 | 3 | 2026-06-20 |
| 15 | Gemini 2.5 Flash | 61.9 | 4 | 2026-08-23 | |
| 16 | Qwen3 235B A22B | Alibaba | 61.8 | 2 | 2026-06-15 |
| 17 | Qwen3 Coder 480B A35B Instruct | Alibaba | 61.8 | 1 | 2026-08-23 |
| 18 | o1 | OpenAI | 61.7 | 6 | 2026-06-04 |
| 19 | Kimi K2 Instruct | Moonshot | 60 | 4 | 2026-08-23 |
| 20 | Kimi K2 (Reasoning) | Moonshot | 59.1 | 1 | 2026-05-01 |
| 21 | Qwen3 235B A22B Instruct 2507 | Alibaba | 57.3 | 1 | 2026-08-23 |
| 22 | Claude Sonnet 4-20250514 (no thinking) | Anthropic | 56.4 | 1 | 2026-06-20 |
| 23 | DeepSeek-V3 | DeepSeek | 55.1 | 12 | 2026-08-23 |
| 24 | Grok 3 Beta | SpaceXAI | 53.3 | 1 | 2026-05-01 |
| 25 | GPT-4.1 | OpenAI | 52.4 | 3 | 2026-08-23 |
| 26 | Qwen3 Next 80B A3B Instruct | Alibaba | 49.8 | 1 | 2026-08-23 |
| 27 | DeepSeek-Chat-V3 (prev) | DeepSeek | 48.4 | 1 | 2026-05-01 |
| 28 | Magistral Medium 1 | Mistral | 47.1 | 1 | 2026-08-23 |
| 29 | Claude 3.5 Sonnet | Anthropic | 45.3 | 6 | 2026-06-04 |
| 30 | chatgpt-4o-latest-20250326 | OpenAI | 45.3 | 2 | 2026-05-01 |
| 31 | GPT-4.5 Preview | OpenAI | 44.9 | 1 | 2026-05-01 |
| 32 | GPT OSS 120B | OpenAI | 41.8 | 1 | 2026-05-01 |
| 33 | Qwen3 32B | Alibaba | 40 | 1 | 2026-05-01 |
| 34 | Gemini Exp 1206 | 38.2 | 1 | 2026-05-01 | |
| 35 | Gemini 2.0 Pro Exp 02.05 | 35.6 | 1 | 2026-05-01 | |
| 36 | Grok 3 Mini Beta | SpaceXAI | 34.7 | 2 | 2026-05-01 |
| 37 | GPT-4.1 mini | OpenAI | 34.7 | 3 | 2026-08-23 |
| 38 | OpenAI o1-mini | OpenAI | 32.9 | 6 | 2026-06-04 |
| 39 | GPT-4o | OpenAI | 30.7 | 9 | 2026-08-23 |
| 40 | Claude 3.5 Haiku | Anthropic | 28 | 2 | 2026-06-19 |
| 41 | Gemini 2.5 Flash Lite | 26.7 | 1 | 2026-08-23 | |
| 42 | Gemini 2.0 Flash Exp | 22.2 | 1 | 2026-05-01 | |
| 43 | Qwen Max | Alibaba | 21.8 | 1 | 2026-05-01 |
| 44 | QwQ 32B Preview | Alibaba | 20.9 | 1 | 2026-05-01 |
| 45 | Gemini 2.0 Flash Thinking Exp 01.21 | 18.2 | 1 | 2026-05-01 | |
| 46 | DeepSeek-V2.5 | DeepSeek | 18.2 | 1 | 2026-05-03 |
| 47 | DeepSeek-Chat-V2.5 | DeepSeek | 17.8 | 1 | 2026-05-01 |
| 48 | Gemini 1.5 Pro | 16.9 | 1 | 2026-05-03 | |
| 49 | Llama 4 Maverick | Meta | 15.6 | 1 | 2026-05-01 |
| 50 | Yi Lightning | 01.AI | 12.9 | 1 | 2026-05-01 |
| 51 | R1-Zero | DeepSeek | 12.2 | 1 | 2026-05-03 |
| 52 | Command A 03-2025 Quality | Cohere | 12 | 1 | 2026-05-01 |
| 53 | Codestral 25.01 | Mistral | 11.1 | 1 | 2026-05-01 |
| 54 | GPT-4.1 nano | OpenAI | 9.8 | 3 | 2026-08-23 |
| 55 | Qwen 2.5 Coder 32B Instruct | Alibaba | 8 | 1 | 2026-05-01 |
| 56 | Qwen2.5 Instruct 72B | Alibaba | 7.6 | 1 | 2026-05-03 |
| 57 | Llama 3.1 Instruct 405B | Meta | 5.8 | 1 | 2026-05-03 |
| 58 | Gemma 3 27B | 4.9 | 1 | 2026-05-01 | |
| 59 | GPT-4o mini | OpenAI | 3.6 | 1 | 2026-05-01 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.