VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.8 vs GPT-5.6 Sol

AnthropicvsOpenAI79 shared benchmarks2056 head-to-head
BenchmarkClaude Opus 4.8GPT-5.6 Sol
AA Agentic Index49.457.8
AA Intelligence57.361
AA-LCR7377.7
AA-Omniscience28.822
Agents' Last Exam2752.7
Agents' Last Exam (Pass / Score)45.153.6
aime_202610099.9
AndroidBench69.874
apex_agents39.456.7
arc_agi_192.597.5
arc_agi_31.57.8
ARC-AGI-272.192.5
arena_elo14821482
arena_text_factuality14641474
Artificial Analysis Coding Index74.378.3
baby_vision_with_python81.288.9
browsecomp88.590.4
charxiv_rq80.587.8
coding_arena_elo15391619
CorpFin v266.764.4
critpt20.932.3
cybergym83.183.6
DeepSWE5973
DeepSWE 1.15973
Finance Agent v253.953.8
GDP (Surge AI)84.830.7
gdpval54.261.1
GDPval-AA v215931748
GDPval-AA v2 (Elo)15931736
GPQA Diamond93.694.6
HealthBench59.357
healthbench_professional57.460.5
HiL-Bench35.332.3
HLE57.949.5
HLE (with tools)57.958
IFBench62.272.7
JobBench48.445.4
Legal Research Bench43.848.1
livebench_agentic_coding50.556.2
livebench_coding81.883.9
livebench_data_analysis6679.8
livebench_instruction_following7271.8
livebench_language79.787.7
livebench_math94.396.2
livebench_reasoning89.291.7
longbench_v269.167.1
mathvision86.795.8
MCP Atlas83.683.6
MCP Mark Verified76.492.9
MLS Bench Lite42.846.2
MMMU-Pro78.984.6
MMVU79.281.2
MRCR v2 256K (8-needle)83.293.8
officeqa_pro66.263.2
OmniDocBench87.985.8
OmniScience Accuracy48.859.4
OmniScience Non-Hallucination60.710.6
OSWorld 2.055.762.6
OSWorld-Verified83.483
PaperBench80.390.5
PerceptionBench47.259.7
PostTrainBench37.234.6
Program Bench71.977.6
ResearchRubrics73.573.8
SaaS-Bench56.161.4
scicode53.556.9
simplebench64.864.8
simpleqa_verified39.571.6
SpreadsheetBench 231.632.4
SWE-bench Pro69.264.6
SWE-Marathon4039
Tau 3 Banking27.633
TauBench V3 - Banking34.244.3
Terminal-Bench 2.18589.5
Terminal-Bench Hard58.365.9
toolathlon59.958
Video-MME8689.5
WorldVQA ForceAnswer39.141.8
τ²-Bench Telecom (AA run)94.485.1

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.