VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.6 vs GPT-5.5

AnthropicvsOpenAI60 shared benchmarks951 head-to-head
BenchmarkClaude Sonnet 4.6GPT-5.5
AA Agentic Index61.647.4
AA Intelligence48.456.3
AA-LCR7479
AA-Omniscience12.220.5
apexAgents2837.7
arc_agi_186.595
ARC-AGI-260.485
arena_elo14721482
arena_text_factuality14601482
arena_vision12781283
Artificial Analysis Coding Index6374.9
browsecomp76.284.4
coding_arena_elo15231457
critpt3.127.1
DeepSWE 1.13067
Finance Agent v25151.8
finance_agent63.360
frontiermath_tier_48.335.4
GDP (Surge AI)78.616.7
gdpval54.849.5
GDPval-AA (Elo)16761769
GDPval-AA v213811509
GPQA Diamond89.993.6
healthbench_professional44.251.8
HLE4952.2
HLE (with tools)46.852.2
IFBench56.675.9
itbenchSre39.845.8
Legal Agent Benchmark5.42.1
Legal Agent Benchmark (Harvey's Held-Out Set)5.42.1
livebench75.580.7
livebench_agentic_coding42.654
livebench_coding79.382.2
livebench_data_analysis7881.6
livebench_instruction_following63.270.7
livebench_language76.187.4
livebench_math8795.9
livebench_reasoning84.889.7
MCP Atlas69.582.8
MMMU-Pro75.683.2
officeqa_pro53.460.9
OmniScience Accuracy40.958
OmniScience Non-Hallucination51.612
OSWorld-Verified78.578.7
scicode4756.1
simpleqa_verified2963.1
SWE-bench Pro58.158.6
SWE-bench Verified79.680.6
TauBench V3 - Banking34.439
Terminal-Bench 2.059.182.7
Terminal-Bench 2.171.284.3
Terminal-Bench Hard59.160.6
toolathlon49.455.6
usamo_20265598.2
vectara_answer_rate99.9100
vectara_avg_summary_length114.7129.6
vectara_factual_consistency89.490.7
vectara_hallucination_rate10.69.3
τ²-Bench Telecom (AA run)97.993.9
τ³-Bench30.531.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.