VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.1 vs GPT-5.4

OpenAIvsOpenAI48 shared benchmarks543 head-to-head
BenchmarkGPT-5.1GPT-5.4
AA Agentic Index32.258.2
AA Intelligence37.553.1
AA-LCR76.777.7
AA-Omniscience5.45.8
arc_agi_172.893.7
ARC-AGI-217.674
arena_elo14391477
arena_text_factuality14451476
arena_vision12501277
Artificial Analysis Coding Index49.471.1
browsecomp50.882.7
coding_arena_elo14211457
critpt4.923.4
frontiermath_tier_412.527.1
gdpval2550.1
GPQA Diamond88.193
HealthBench Consensus length-adjusted9596.3
HealthBench Hard length-adjusted25.429.1
HealthBench Professional length-adjusted39.648.1
healthbench_length_adjusted50.954
HLE28.543.7
HLE (with tools)42.752.1
hmmt_nov_202591.795.8
IFBench72.973.9
Image input eval - extremism (not_unsafe)11
Image input eval - harms-erotic (not_unsafe)11
Image input eval - hate (not_unsafe)11
Image input eval - self-harm (not_unsafe)11
matharena_visual_math_overall76.992.5
MCP Atlas50.170.6
MMLU-Pro8787.5
MMMU-Pro75.581.2
MultiNRC4958.3
OmniScience Accuracy37.750.9
OmniScience Non-Hallucination48.117.4
scicode43.356.6
SEAL VISTA43.850.9
simpleqa_verified48.945.3
TauBench V3 - Banking15.939.6
Terminal-Bench 2.047.675.1
Terminal-Bench 2.152.478.3
Terminal-Bench Hard45.557.6
vectara_answer_rate10099.9
vectara_avg_summary_length254.481.7
vectara_factual_consistency89.193
vectara_hallucination_rate12.17
τ²-Bench Telecom (AA run)81.987.1
τ³-Bench1472.9

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.