VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.4 vs GPT-5.5

OpenAIvsOpenAI73 shared benchmarks1459 head-to-head
BenchmarkGPT-5.4GPT-5.5
AA Agentic Index58.247.4
AA Intelligence53.156.3
AA-LCR77.779
AA-Omniscience5.820.5
aime_202699.2100
apexAgents33.337.7
arc_agi_193.795
arc_agi_30.20.4
ARC-AGI-27485
arena_elo14771482
arena_text_factuality14761482
arena_vision12771283
Artificial Analysis Coding Index71.174.9
browsecomp82.784.4
coding_arena_elo14571457
critpt23.427.1
cybergym66.381.8
DeepSWE 1.15267
DNA sequence design for transcription factor binding12.813.8
finance_agent57.260
frontiermath_tier_427.135.4
gdpval50.149.5
GDPval-AA (Elo)16741769
GPQA Diamond9393.6
Hard-negative protein binding prediction3.51.5
HealthBench Consensus length-adjusted96.395.6
HealthBench Hard length-adjusted29.131.5
HealthBench Professional length-adjusted48.151.8
healthbench_length_adjusted5456.5
HiL-Bench9.739.7
HLE43.752.2
HLE (with tools)52.152.2
hmmt_feb_202697.798.5
hmmt_nov_202595.896.5
IFBench73.975.9
Image input eval - extremism (not_unsafe)11
Image input eval - harms-erotic (not_unsafe)11
Image input eval - hate (not_unsafe)11
Image input eval - self-harm (not_unsafe)11
itbenchSre34.545.8
Legal Agent Benchmark0.42.1
livebench80.380.7
livebench_agentic_coding53.854
livebench_coding77.582.2
livebench_data_analysis79.381.6
livebench_instruction_following70.270.7
livebench_language82.687.4
livebench_math94.295.9
livebench_reasoning88.189.7
matharena_visual_math_overall92.594.9
MCP Atlas70.682.8
MMMU-Pro81.283.2
nl2repo41.350.7
officeqa_pro51.160.9
OmniScience Accuracy50.958
OmniScience Non-Hallucination17.412
OSWorld-Verified7578.7
scicode56.656.1
simpleqa_verified45.363.1
SWE-bench Pro59.158.6
TauBench V3 - Banking39.639
Terminal-Bench 2.075.182.7
Terminal-Bench 2.178.384.3
Terminal-Bench Hard57.660.6
tool_decathlon54.655.6
toolathlon54.655.6
usamo_202695.298.2
vectara_answer_rate99.9100
vectara_avg_summary_length81.7129.6
vectara_factual_consistency9390.7
vectara_hallucination_rate79.3
τ²-Bench Telecom (AA run)87.193.9
τ³-Bench72.931.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.