Claude Mythos 5.1 vs GPT-5.6 Sol
4 SHARED BENCHMARKSAcross 4 shared benchmarks, Claude Mythos 5.1 scores higher on 4 and GPT-5.6 Sol on 0. The widest gap is Terminal-Bench 4.0, where Claude Mythos 5.1 scores 60.9 against 37.3.
ANTHROPICVSOPENAI4 SHARED4–0 HEAD-TO-HEAD
BioMysteryBench (Human Difficult)44.128.8
BioMysteryBench (Human Solvable)90.386.1
Terminal-Bench 4.060.937.3
Best tracked score per model per benchmark (default configuration; source-attributed). ↓ marks lower-is-better metrics. Open either model for its full surface, provenance and pricing.
Compare GPT-5.6 Sol withEVERY TRACKED PAIRING
▶Anthropic12 PAIRINGS
▶OpenAI10 PAIRINGS
▶Google11 PAIRINGS
▶Alibaba11 PAIRINGS
▶DeepSeek5 PAIRINGS
▶Moonshot4 PAIRINGS
▶Meta2 PAIRINGS
▶Z.ai2 PAIRINGS
▶MiniMax1 PAIRING
▶NVIDIA1 PAIRING