VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.1 vs GPT-5.5

OpenAIvsOpenAI48 shared benchmarks542 head-to-head
BenchmarkGPT-5.1GPT-5.5
AA Agentic Index32.247.4
AA Intelligence37.556.3
AA-LCR76.779
AA-Omniscience5.420.5
arc_agi_172.895
ARC-AGI-217.685
arena_elo14391482
arena_text_factuality14451482
arena_vision12501283
Artificial Analysis Coding Index49.474.9
browsecomp50.884.4
coding_arena_elo14211457
critpt4.927.1
Fortress25.716.3
frontiermath_tier_412.535.4
gdpval2549.5
GPQA Diamond88.193.6
HealthBench Consensus length-adjusted9595.6
HealthBench Hard length-adjusted25.431.5
HealthBench Professional length-adjusted39.651.8
healthbench_length_adjusted50.956.5
HLE28.552.2
HLE (with tools)42.752.2
hmmt_nov_202591.796.5
IFBench72.975.9
Image input eval - extremism (not_unsafe)11
Image input eval - harms-erotic (not_unsafe)11
Image input eval - hate (not_unsafe)11
Image input eval - self-harm (not_unsafe)11
matharena_visual_math_overall76.994.9
MCP Atlas50.182.8
MMMU-Pro75.583.2
OmniScience Accuracy37.758
OmniScience Non-Hallucination48.112
scicode43.356.1
simplebench53.269
simpleqa_verified48.963.1
SWE-bench Verified76.380.6
TauBench V3 - Banking15.939
Terminal-Bench 2.047.682.7
Terminal-Bench 2.152.484.3
Terminal-Bench Hard45.560.6
vectara_answer_rate100100
vectara_avg_summary_length254.4129.6
vectara_factual_consistency89.190.7
vectara_hallucination_rate12.19.3
τ²-Bench Telecom (AA run)81.993.9
τ³-Bench1431.3

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.