VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.6 vs GPT-5.2

AnthropicvsOpenAI75 shared benchmarks4728 head-to-head
BenchmarkClaude Opus 4.6GPT-5.2
AA Agentic Index67.660.2
AA Intelligence44.943.3
AA-LCR74.379.3
AA-Omniscience13.70.3
AIME 202599.8100
aime_202696.798.3
AIME25 no tools95.698
apexAgents3323
arc_agi_19386.2
ARC-AGI-268.852.9
arena_elo14971437
arena_text_factuality14871442
arena_vision13001245
Artificial Analysis Coding Index48.148.7
browsecomp86.865.8
browsecomp_with_context_manager8465.8
charxiv_rq69.182.1
coding_arena_elo15451418
critpt12.611.6
deepsearchqa_f191.371.3
Fortress20.517.5
frontiermath_tier_422.918.8
gdpval55.948.3
GDPval-AA (Elo)16191462
GPQA Diamond91.392.4
HLE53.145.5
HLE (with tools)62.745.5
hmmt_feb_202696.297
hmmt_nov_202596.399.2
IFBench62.575.4
imo_answer_bench75.386.3
livebench76.374.8
livebench_agentic_coding4950.3
livebench_coding78.276.1
livebench_data_analysis69.978.2
livebench_instruction_following63.361.8
livebench_language83.379.8
livebench_math89.393.2
livebench_reasoning88.783.2
LiveCodeBench88.889
matharena_visual_math_overall72.386.5
mathvision71.283
MCP Atlas76.868
metr_hcast7777
metr_re_bench97.435
metr_swaa98.599.6
MMLU-Pro89.187
mmmlu91.189.6
MMMU-Pro77.379.5
mrcr_v2_8needle_128k_average8483.8
MultiNRC57.142.2
ocrbench_v248.450.5
OmniDocBench 1.586.685.7
OmniScience Accuracy4744.3
OmniScience Non-Hallucination37.238.4
scicode5252.1
screenspot_pro_no_tools57.786.3
SEAL VISTA46.146.6
simplebench67.645.8
simpleqa_verified46.538.9
swe_bench_bash75.672.8
SWE-bench Multilingual77.872
SWE-bench Pro57.355.6
SWE-bench Verified80.880
Tau2 retail91.982
Terminal-Bench 2.065.454
Terminal-Bench Hard65.462.2
tool_decathlon47.246.3
toolathlon56.846.3
vectara_answer_rate99.8100
vectara_avg_summary_length137.6186.3
vectara_factual_consistency87.889.2
vectara_hallucination_rate12.210.8
τ²-Bench Telecom (AA run)99.398.7
τ³-Bench72.412

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.