GPT-5.4 Codex vs Claude Opus 4.7, el juez del código

GPT-5.4 CodexClaude Opus 4.7
arenaElo14081420
humanEval95.593.1
sweBench7064.3
mmlu88.692.3
gpqa60.865.2
aime8688
Precio in/out ($/M)$9 / $36$5 / $25

Nuestro veredicto

5.4 Codex mantiene la corona HumanEval (95.5 vs 93.1) y es más barato por token. Opus 4.7 compensa con 2.5× más de contexto y agentes de largo recorrido más fuertes. Pipelines especializados de código, codex. Agentes de coding que también razonan y planifican, opus.

GPT-5.4 Codex · Claude Opus 4.7 · Todas las comparativas de IA