Berkeley Function-Calling Leaderboard v3 — Overall/general BFCL v3 aggregate; MultiTurn is a distinct subset, kept separate
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | GLM-4.5 | Z.ai | 77.8 | 1 | 2026-08-23 |
| 2 | GLM-4.5-Air | Z.ai | 76.4 | 1 | 2026-08-23 |
| 3 | Granite 4.1 30B | IBM | 73.7 | 1 | 2026-06-15 |
| 4 | Qwen3 30B A3B | Alibaba | 73.4 | 1 | 2026-08-09 |
| 5 | Qwen3 Next 80B A3B | Alibaba | 72 | 1 | 2026-08-23 |
| 6 | MAI-Thinking-1 | Microsoft | 72 | 1 | 2026-08-23 |
| 7 | Qwen3 VL 235B A22B Reasoning | Alibaba | 71.9 | 1 | 2026-08-23 |
| 8 | Qwen3 VL 32B Reasoning | Alibaba | 71.7 | 1 | 2026-08-23 |
| 9 | Qwen3.5 4B | Alibaba | 71.1 | 1 | 2026-08-09 |
| 10 | Qwen3 235B A22B Instruct 2507 | Alibaba | 70.9 | 1 | 2026-08-23 |
| 11 | Qwen3 Next 80B A3B Instruct | Alibaba | 70.3 | 1 | 2026-08-23 |
| 12 | Qwen3 VL 32B Instruct | Alibaba | 70.2 | 1 | 2026-08-23 |
| 13 | Qwen3 Coder 480B A35B Instruct | Alibaba | 68.7 | 1 | 2026-08-23 |
| 14 | Qwen3 VL 30B A3B Reasoning | Alibaba | 68.6 | 1 | 2026-08-23 |
| 15 | Granite 4.1 8B | IBM | 68.3 | 1 | 2026-06-15 |
| 16 | Qwen3 VL 235B A22B Instruct | Alibaba | 67.7 | 1 | 2026-08-23 |
| 17 | Qwen3 VL 4B (Reasoning) | Alibaba | 67.3 | 1 | 2026-08-23 |
| 18 | Qwen3 VL 30B A3B Instruct | Alibaba | 66.3 | 1 | 2026-08-23 |
| 19 | Qwen3 VL 8B Instruct | Alibaba | 66.3 | 1 | 2026-08-23 |
| 20 | LFM2.5-8B-A1B | Liquid AI | 64.8 | 1 | 2026-08-09 |
| 21 | Qwen3 VL 4B Instruct | Alibaba | 63.3 | 1 | 2026-08-23 |
| 22 | Qwen3 VL Thinking (8B) | Alibaba | 63 | 1 | 2026-08-23 |
| 23 | Gemma 4 E4B | 57.3 | 1 | 2026-08-09 | |
| 24 | lfm-2.5-1.2b-thinking:free | Liquid AI | 57 | 1 | 2026-08-09 |
| 25 | Granite 4.0 H Tiny | IBM | 56.9 | 1 | 2026-08-09 |
| 26 | Gemma 4 E2B | 56.4 | 1 | 2026-08-09 | |
| 27 | Qwen3 1.7B | Alibaba | 55.4 | 1 | 2026-08-09 |
| 28 | Granite 4.0 1B | IBM | 52.4 | 2 | 2026-08-09 |
| 29 | Granite 4.0 H 1B | IBM | 50.7 | 1 | 2026-08-09 |
| 30 | Qwen3 1.7B (instruct) | Alibaba | 46.3 | 2 | 2026-08-09 |
| 31 | LFM2.5-350M | Liquid AI | 44.1 | 2 | 2026-08-09 |
| 32 | LFM2.5-230M | Liquid AI | 43.3 | 1 | 2026-08-09 |
| 33 | Qwen3.5 0.8B | Alibaba | 39.6 | 1 | 2026-08-09 |
| 34 | Granite 4.0 350M | IBM | 39.6 | 2 | 2026-08-09 |
| 35 | Qwen3.5 0.8B (Instruct) | Alibaba | 35.1 | 2 | 2026-08-09 |
| 36 | LFM2-350M | Liquid AI | 22.9 | 2 | 2026-08-09 |
| 37 | Gemma 3 1B IT | 16.6 | 4 | 2026-08-09 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.