GPT-5 Codex vs Claude Opus 4.7: ¿Mejor modelo para programar en 2026?

GPT-5 CodexClaude Opus 4.7
arenaElo13951420
humanEval94.893.1
sweBench6864.3
mmlu87.292.3
gpqa58.465.2
aime8588
Precio in/out ($/M)$8 / $32$15 / $75

Nuestro veredicto

GPT-5 Codex lidera HumanEval por un pelo (94.8 vs 93.1) y es más barato. Opus 4.7 tiene más contexto (1M vs 400K) y mejor estabilidad de agente en ejecuciones de horas. Para PRs puntuales, Codex. Para refactors a nivel repo y agentes, Opus.

GPT-5 Codex · Claude Opus 4.7 · Todas las comparativas de IA