VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Sonnet 4.6 vs GPT-5.4

AnthropicvsOpenAI64 shared benchmarks1944 head-to-head
BenchmarkClaude Sonnet 4.6GPT-5.4
AA Agentic Index61.658.2
AA Intelligence48.453.1
AA-LCR7477.7
AA-Omniscience12.25.8
AgentWorldBench - Android5860
AgentWorldBench - MCP7070.1
AgentWorldBench - OS63.268.6
AgentWorldBench - Overall5658.3
AgentWorldBench - Search28.837.3
AgentWorldBench - SWE64.566.3
AgentWorldBench - Terminal5753.7
AgentWorldBench - Web50.851.8
apexAgents2833.3
arc_agi_186.593.7
ARC-AGI-260.474
arena_elo14721477
arena_text_factuality14601476
arena_vision12781277
Artificial Analysis Coding Index6371.1
browsecomp76.282.7
charxiv_rq72.482.8
coding_arena_elo15231457
critpt3.123.4
DeepSWE 1.13052
finance_agent63.357.2
frontiermath_tier_48.327.1
gdpval54.850.1
GDPval-AA (Elo)16761674
GPQA Diamond89.993
HLE4943.7
HLE (with tools)46.852.1
IFBench56.673.9
itbenchSre39.834.5
Legal Agent Benchmark5.40.4
livebench75.580.3
livebench_agentic_coding42.653.8
livebench_coding79.377.5
livebench_data_analysis7879.3
livebench_instruction_following63.270.2
livebench_language76.182.6
livebench_math8794.2
livebench_reasoning84.888.1
MCP Atlas69.570.6
MMMU-Pro75.681.2
officeqa68.768.1
officeqa_pro53.451.1
OmniScience Accuracy40.950.9
OmniScience Non-Hallucination51.617.4
OSWorld-Verified78.575
scicode4756.6
simpleqa_verified2945.3
SWE-bench Pro58.159.1
TauBench V3 - Banking34.439.6
Terminal-Bench 2.059.175.1
Terminal-Bench 2.171.278.3
Terminal-Bench Hard59.157.6
toolathlon49.454.6
usamo_20265595.2
vectara_answer_rate99.999.9
vectara_avg_summary_length114.781.7
vectara_factual_consistency89.493
vectara_hallucination_rate10.67
τ²-Bench Telecom (AA run)97.987.1
τ³-Bench30.572.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.