Gemini tech-report internal 'Finance Agent v2' expert-tasks eval — Google internal finance-agent suite, v2 — distinct from Anthropic's.
| # | Model | Vendor | Best score | Runs | Last seen |
|---|---|---|---|---|---|
| 1 | Opus 5 | Anthropic | 58.6 | 1 | 2026-07-29 |
| 2 | Gemini 3.5 Flash | 57.9 | 4 | 2026-08-24 | |
| 3 | Muse Spark 1.1 | Meta | 57.2 | 2 | 2026-08-23 |
| 4 | Claude Fable 5 | Anthropic | 56.3 | 2 | 2026-08-24 |
| 5 | Kimi K3 | Moonshot | 54.4 | 1 | 2026-08-24 |
| 6 | Claude Opus 4.8 | Anthropic | 53.9 | 3 | 2026-08-24 |
| 7 | GPT-5.6 Sol | OpenAI | 53.8 | 1 | 2026-08-24 |
| 8 | GPT-5.5 | OpenAI | 51.8 | 1 | 2026-08-23 |
| 9 | Claude Opus 4.7 | Anthropic | 51.5 | 3 | 2026-08-23 |
| 10 | Claude Sonnet 4.6 | Anthropic | 51 | 2 | 2026-08-23 |
| 11 | Qwen3.7 Max | Alibaba | 48.4 | 1 | 2026-08-23 |
| 12 | MiniMax M3 | MiniMax | 48.3 | 1 | 2026-08-23 |
| 13 | GPT-5.4 mini | OpenAI | 45.4 | 1 | 2026-08-23 |
| 14 | Kimi K2.6 | Moonshot | 44.9 | 1 | 2026-08-23 |
| 15 | GLM-5.1 | Z.ai | 44.8 | 1 | 2026-08-23 |
| 16 | Gemini 3.1 Pro | 43 | 2 | 2026-08-23 | |
| 17 | Gemini 3 Flash Preview | 42.6 | 2 | 2026-08-23 | |
| 18 | MiMo V2.5 Pro | Xiaomi | 41.5 | 1 | 2026-08-23 |
| 19 | Qwen3.6 Plus | Alibaba | 40.9 | 1 | 2026-08-23 |
| 20 | Qwen3.7 Plus Preview | Alibaba | 38.2 | 1 | 2026-08-23 |
| 21 | GPT-5.4 nano | OpenAI | 38.2 | 1 | 2026-08-23 |
| 22 | Grok 4.3 | SpaceXAI | 37.7 | 1 | 2026-08-23 |
| 23 | Claude Haiku 4.5 | Anthropic | 31 | 1 | 2026-08-23 |
| 24 | Gemini 3.1 Flash Lite Preview | 30 | 1 | 2026-08-23 | |
| 25 | Grok 4.20 (Beta Reasoning) | SpaceXAI | 28.5 | 1 | 2026-08-23 |
| 26 | MiniMax M2.7 | MiniMax | 27.9 | 1 | 2026-08-23 |
Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.