VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

GPT-5.1 vs GPT-5.2

OpenAIvsOpenAI56 shared benchmarks1737 head-to-head
BenchmarkGPT-5.1GPT-5.2
AA Agentic Index32.260.2
AA Intelligence37.543.3
AA-LCR76.779.3
AA-Omniscience5.40.3
AIME 202594.2100
arc_agi_172.886.2
ARC-AGI-217.652.9
arena_elo14391437
arena_text_factuality14451442
arena_vision12501245
Artificial Analysis Coding Index49.448.7
browsecomp50.865.8
coding_arena_elo14211418
critpt4.911.6
Fortress25.717.5
frontiermath_tier_412.518.8
gdpval2548.3
GPQA Diamond88.192.4
HealthBench Consensus length-adjusted9594.4
HealthBench Hard length-adjusted25.434.3
HealthBench Professional length-adjusted39.645.9
healthbench_length_adjusted50.956.8
HLE28.545.5
HLE (with tools)42.745.5
hmmt_feb_202596.3100
hmmt_nov_202591.799.2
IFBench72.975.4
Image input eval - extremism (not_unsafe)11
Image input eval - harms-erotic (not_unsafe)11
Image input eval - hate (not_unsafe)11
Image input eval - self-harm (not_unsafe)11
matharena_visual_math_overall76.986.5
MCP Atlas50.168
MMLU-Pro8787
mmmlu9189.6
MMMU-Pro75.579.5
MultiNRC4942.2
OmniScience Accuracy37.744.3
OmniScience Non-Hallucination48.138.4
scicode43.352.1
SEAL VISTA43.846.6
simplebench53.245.8
simpleqa_verified48.938.9
swe_bench_bash6672.8
SWE-bench Verified76.380
Tau2 retail77.982
TauBench V3 - Banking15.911.1
Terminal-Bench 2.047.654
Terminal-Bench Hard45.562.2
vectara_answer_rate100100
vectara_avg_summary_length254.4186.3
vectara_factual_consistency89.189.2
vectara_hallucination_rate12.110.8
τ²-Bench82.785.5
τ²-Bench Telecom (AA run)81.998.7
τ³-Bench1412

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.