VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.6 vs GPT-5.5

AnthropicvsOpenAI63 shared benchmarks2043 head-to-head
BenchmarkClaude Opus 4.6GPT-5.5
AA Agentic Index67.647.4
AA Intelligence44.956.3
AA-LCR74.379
AA-Omniscience13.720.5
aime_202696.7100
apexAgents3337.7
arc_agi_19395
arc_agi_30.50.4
ARC-AGI-268.885
arena_elo14971482
arena_text_factuality14871482
arena_vision13001283
Artificial Analysis Coding Index48.174.9
browsecomp86.884.4
BrowseComp (single-agent)83.784.4
coding_arena_elo15451457
critpt12.627.1
cybergym73.881.8
finance_agent76.760
Fortress20.516.3
frontiermath_tier_422.935.4
gdpval55.949.5
GDPval-AA (Elo)16191769
GPQA Diamond91.393.6
HiL-Bench38.339.7
HLE53.152.2
HLE (with tools)62.752.2
hmmt_feb_202696.298.5
hmmt_nov_202596.396.5
IFBench62.575.9
Legal Agent Benchmark4.22.1
livebench76.380.7
livebench_agentic_coding4954
livebench_coding78.282.2
livebench_data_analysis69.981.6
livebench_instruction_following63.370.7
livebench_language83.387.4
livebench_math89.395.9
livebench_reasoning88.789.7
matharena_visual_math_overall72.394.9
MCP Atlas76.882.8
MMMU-Pro77.383.2
nl2repo49.850.7
officeqa_pro57.160.9
OmniScience Accuracy4758
OmniScience Non-Hallucination37.212
OSWorld-Verified72.778.7
scicode5256.1
simplebench67.669
simpleqa_verified46.563.1
SWE-bench Pro57.358.6
SWE-bench Verified80.880.6
Terminal-Bench 2.065.482.7
Terminal-Bench Hard65.460.6
tool_decathlon47.255.6
toolathlon56.855.6
usamo_202666.298.2
vectara_answer_rate99.8100
vectara_avg_summary_length137.6129.6
vectara_factual_consistency87.890.7
vectara_hallucination_rate12.29.3
τ²-Bench Telecom (AA run)99.393.9
τ³-Bench72.431.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.