VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.8 vs Opus 5

AnthropicvsAnthropic54 shared benchmarks648 head-to-head
BenchmarkClaude Opus 4.8Opus 5
AA Agentic Index49.459.2
AA Intelligence57.363.1
AA-LCR7378.7
AA-Omniscience28.837.1
arc_agi_192.597.5
arc_agi_31.530.2
ARC-AGI-272.190.4
arena_elo14821487
arena_text_factuality14641481
Artificial Analysis Coding Index74.378
browsecomp88.590.8
coding_arena_elo15391662
critpt20.929.1
DeepSWE 1.15968.8
Finance Agent v253.958.6
GDP (Surge AI)84.885.5
gdpval54.267.2
GDPval-AA (Elo)18901827
GDPval-AA v215931861
GPQA Diamond93.693.7
HealthBench59.367.1
HealthBench (raw)58.867.1
HealthBench Professional (raw)60.373.4
healthbench_professional57.459.8
HiL-Bench35.357
HLE57.964.7
HLE (with tools)57.964.7
Legal Agent Benchmark1023
livebench_agentic_coding50.565.2
livebench_coding81.881.5
livebench_data_analysis6674.5
livebench_instruction_following7263.8
livebench_language79.788.7
livebench_math94.395.7
livebench_reasoning89.291.2
MCP Atlas83.685.8
MMMU-Pro78.984.7
officeqa77.678.1
officeqa_pro66.266.9
OmniScience Accuracy48.860.9
OmniScience Non-Hallucination60.740.5
OSWorld 2.055.770.6
OSWorld-Verified83.44
RiemannBench3460
scicode53.555.7
simplebench64.880.6
simpleqa_verified39.556.7
swe_bench_multimodal38.459.4
SWE-bench Multilingual84.489.5
SWE-bench Pro69.279.2
SWE-bench Verified88.696
TauBench V3 - Banking34.244.7
Terminal-Bench 2.18589.1
Toolathlon Verified Pass@38887

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.