VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.7 vs GPT-5.5

AnthropicvsOpenAI62 shared benchmarks2240 head-to-head
BenchmarkClaude Opus 4.7GPT-5.5
AA Agentic Index64.647.4
AA Intelligence5556.3
AA-LCR75.379
AA-Omniscience27.320.5
aime_202695.8100
arc_agi_19295
arc_agi_30.20.4
ARC-AGI-275.885
arena_elo14941482
arena_text_factuality14741482
arena_vision13041283
Artificial Analysis Coding Index73.674.9
browsecomp79.884.4
coding_arena_elo15571457
critpt1227.1
cybergym73.881.8
Finance Agent v251.551.8
finance_agent71.560
frontiermath_tier_422.935.4
gdpval58.649.5
GDPval-AA (Elo)17531769
GPQA Diamond94.293.6
GraphWalks — Parents task, 256K-token context subset93.690.1
GraphWalks BFS 256K76.973.7
HiL-Bench41.739.7
HLE54.752.2
HLE (with tools)54.752.2
hmmt_feb_202693.998.5
IFBench58.675.9
itbenchSre46.745.8
Legal Agent Benchmark7.12.1
livebench76.980.7
livebench_agentic_coding50.754
livebench_coding82.182.2
livebench_data_analysis78.381.6
livebench_instruction_following66.770.7
livebench_language77.987.4
livebench_math92.895.9
livebench_reasoning87.289.7
MCP Atlas79.182.8
MMMU-Pro78.883.2
officeqa_pro80.660.9
OmniScience Accuracy48.958
OmniScience Non-Hallucination57.712
OSWorld-Verified82.878.7
scicode54.556.1
simplebench61.769
simpleqa_verified50.663.1
SWE-bench Pro64.358.6
SWE-bench Verified87.680.6
TauBench V3 - Banking34.639
Terminal-Bench 2.069.482.7
Terminal-Bench 2.183.184.3
Terminal-Bench Hard54.560.6
toolathlon59.355.6
usamo_202669.398.2
vectara_answer_rate98100
vectara_avg_summary_length149.1129.6
vectara_factual_consistency8890.7
vectara_hallucination_rate129.3
τ²-Bench Telecom (AA run)88.693.9
τ³-Bench28.931.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.