VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.5 vs Qwen3.5 397B A17B

AnthropicvsAlibaba48 shared benchmarks1830 head-to-head
BenchmarkClaude Sonnet 4.5Qwen3.5 397B A17B
AA Agentic Index50.653.3
AA Intelligence37.434.3
AA-LCR68.372.7
AA-Omniscience-0.1-30.8
arena_elo14561442
arena_text_factuality14481445
Artificial Analysis Coding Index52.148.2
browsecomp24.169
BrowseComp (context management)26.178.6
browsecomp_zh42.470.3
CC-OCR68.182
charxiv_rq67.280.8
coding_arena_elo13921399
critpt1.11.7
gdpval40.435.8
GPQA Diamond83.489.3
HLE19.829
HLE (with tools)3248.3
HMMT 202574.692.7
hmmt_feb_202579.294.8
hmmt_nov_202581.792.7
IFBench57.378.8
imo_answer_bench65.980.9
LiveCodeBench v66483.6
longbench_v261.863.2
mmlu_redux95.694.9
MMLU-Pro88.287.8
mmmlu89.188.5
MMMU79.685
MMMU-Pro68.779
multichallenge55.367.6
OmniScience Accuracy32.930.8
OmniScience Non-Hallucination50.917.3
RealWorldQA70.383.9
scicode4542
Seal-053.446.9
simpleqa_verified23.626
SimpleVQA57.667.1
SWE-bench Multilingual6869.3
SWE-bench Pro43.650.9
SWE-bench Verified8276.4
TauBench V3 - Banking24.513.4
Terminal-Bench 2.05052.5
Terminal-Bench 2.155.851.3
Terminal-Bench Hard35.640.9
toolathlon4138.3
τ²-Bench Telecom (AA run)78.195.6
τ³-Bench1913.4

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.