VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

Claude Opus 4.8 vs GPT-5.2

AnthropicvsOpenAI59 shared benchmarks4414 head-to-head
BenchmarkClaude Opus 4.8GPT-5.2
AA Agentic Index49.460.2
AA Intelligence57.343.3
AA-LCR7379.3
AA-Omniscience28.80.3
aime_202610098.3
arc_agi_192.586.2
ARC-AGI-272.152.9
arena_elo14821437
arena_text_factuality14641442
arena_vision12801245
Artificial Analysis Coding Index74.348.7
browsecomp88.565.8
charxiv_rq80.582.1
coding_arena_elo15391418
critpt20.911.6
deepsearchqa_f193.171.3
Fortress18.217.5
frontiermath_tier_431.318.8
gdpval54.248.3
GDPval-AA (Elo)18901462
GPQA Diamond93.692.4
HLE57.945.5
HLE (with tools)57.945.5
hmmt_feb_202696.797
hmmt_nov_202596.599.2
IFBench62.275.4
imo_answer_bench83.586.3
livebench77.274.8
livebench_agentic_coding50.550.3
livebench_coding81.876.1
livebench_data_analysis6678.2
livebench_instruction_following7261.8
livebench_language79.779.8
livebench_math94.393.2
livebench_reasoning89.283.2
longbench_v269.154.5
matharena_visual_math_overall81.686.5
mathvision86.783
MCP Atlas83.668
MMMU-Pro78.979.5
MMVU79.280.8
OmniScience Accuracy48.844.3
OmniScience Non-Hallucination60.738.4
PaperBench80.363.7
scicode53.552.1
screenspot_pro_no_tools87.986.3
simplebench64.845.8
simpleqa_verified39.538.9
SWE-bench Multilingual84.472
SWE-bench Pro69.255.6
SWE-bench Verified88.680
TauBench V3 - Banking34.211.1
Terminal-Bench 2.074.654
Terminal-Bench Hard58.362.2
tool_decathlon59.946.3
toolathlon59.946.3
Video-MME8686
τ²-Bench Telecom (AA run)94.498.7
τ³-Bench27.612

Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.