VECTOR WIREAI INTELLIGENCE
NVDA$1,847+3.2%MSFT$512+1.1%GOOGL$199-0.4%META$728+2.7%AMD$184-1.2%TSM$212+0.6%PLTR$98+4.1%AI IDX4,821+1.9%
PKT
SEEDRefresh Models Deals Regulatory Sources

metr_re_bench

18 models tracked

METR RE-Bench (Research Engineering Benchmark) — Distinct METR task suite from HCAST and SWAA.

#ModelVendorBest scoreRunsLast seen
1Claude Opus 4.6Anthropic97.412026-05-10
2GPT-5.1 Codex MaxOpenAI43.312026-05-10
3Claude Opus 4.5Anthropic4012026-05-10
4GPT-5OpenAI4012026-05-10
5GPT-5.2OpenAI3512026-05-10
6Gemini 3 ProGoogle3512026-05-10
7GPT-5.3 CodexOpenAI2512026-05-10
8Claude 4 OpusAnthropic2012026-05-10
9Claude 3.5 Sonnet (Old) (Inspect)Anthropic1512026-05-10
10o3OpenAI1512026-05-10
11Claude Opus 4.1Anthropic1522026-06-01
12Claude 3.5 Sonnet (New) (Inspect)Anthropic512026-05-10
13o1OpenAI012026-05-10
14GPT4OpenAI022026-05-10
15Claude 3 OpusAnthropic012026-05-10
16Claude 3.7 SonnetAnthropic012026-05-10
17GPT-4oOpenAI012026-05-10
18GPT-4 TurboOpenAI012026-05-10

Best tracked score per model (default configuration; source-attributed and verification-tiered). Open a model for its full benchmark surface, provenance and pricing.