VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.7 vs Qwen3.7 Plus Preview

AnthropicvsAlibaba33 shared benchmarks276 head-to-head
BenchmarkClaude Opus 4.7Qwen3.7 Plus Preview
AA Agentic Index64.620.8
AA Intelligence5539.4
AA-LCR75.369
AA-Omniscience27.32.4
arena_elo14941458
arena_text_factuality14741454
arena_vision13041263
Artificial Analysis Coding Index73.655.9
charxiv_rq82.185.9
critpt129.1
Finance Agent v251.538.2
gdpval58.622.2
GPQA Diamond94.290.3
HLE54.735.6
hmmt_feb_202693.992.9
IFBench58.679.1
MCP Atlas79.173.2
mmmlu91.589
MMMU-Pro78.880.5
OmniScience Accuracy48.922.5
OmniScience Non-Hallucination57.774.5
OSWorld-Verified82.873.3
scicode54.551.3
screenspot_pro_no_tools79.579
SWE-bench Multilingual80.575.8
SWE-bench Pro64.357.6
SWE-bench Verified87.677.7
TauBench V3 - Banking34.617.9
Terminal-Bench 2.069.470.3
Terminal-Bench 2.183.161
Terminal-Bench Hard54.547
τ²-Bench Telecom (AA run)88.693
τ³-Bench28.917.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.