VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.7 vs GPT-5.4

AnthropicvsOpenAI60 shared benchmarks3129 head-to-head
BenchmarkClaude Opus 4.7GPT-5.4
AA Agentic Index64.658.2
AA Intelligence5553.1
AA-LCR75.377.7
AA-Omniscience27.35.8
aime_202695.899.2
arc_agi_19293.7
arc_agi_30.20.2
ARC-AGI-275.874
arena_elo14941477
arena_text_factuality14741476
arena_vision13041277
Artificial Analysis Coding Index73.671.1
browsecomp79.882.7
charxiv_rq82.182.8
coding_arena_elo15571457
critpt1223.4
cybergym73.866.3
finance_agent71.557.2
frontiermath_tier_422.927.1
gdpval58.650.1
GDPval-AA (Elo)17531674
GPQA Diamond94.293
HiL-Bench41.79.7
HLE54.743.7
HLE (with tools)54.752.1
hmmt_feb_202693.997.7
IFBench58.673.9
itbenchSre46.734.5
Legal Agent Benchmark7.10.4
livebench76.980.3
livebench_agentic_coding50.753.8
livebench_coding82.177.5
livebench_data_analysis78.379.3
livebench_instruction_following66.770.2
livebench_language77.982.6
livebench_math92.894.2
livebench_reasoning87.288.1
MCP Atlas79.170.6
MMMU-Pro78.881.2
officeqa86.368.1
officeqa_pro80.651.1
OmniScience Accuracy48.950.9
OmniScience Non-Hallucination57.717.4
OSWorld-Verified82.875
scicode54.556.6
simpleqa_verified50.645.3
SWE-bench Multilingual80.571.7
SWE-bench Pro64.359.1
TauBench V3 - Banking34.639.6
Terminal-Bench 2.069.475.1
Terminal-Bench 2.183.178.3
Terminal-Bench Hard54.557.6
toolathlon59.354.6
usamo_202669.395.2
vectara_answer_rate9899.9
vectara_avg_summary_length149.181.7
vectara_factual_consistency8893
vectara_hallucination_rate127
τ²-Bench Telecom (AA run)88.687.1
τ³-Bench28.972.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.