| Claude Code | GPT-5.4 Codex | |
|---|---|---|
| arenaElo | 1420 | 1408 |
| humanEval | 93.1 | 95.5 |
| sweBench | 64.3 | 70 |
| mmlu | 92.3 | 88.6 |
| gpqa | 65.2 | 60.8 |
| aime | 88 | 86 |
| Precio in/out ($/M) | $15 / $75 | $9 / $36 |
GPT-5.4 Codex puntúa más alto en HumanEval aislado, pero la orquestación, hooks y memoria de Claude Code le dan ventaja a Opus 4.7 en ejecuciones largas. Si tu flujo cabe en una CLI, Claude Code gana en tiempo real; si integras en tu propio harness, elige 5.4 Codex directamente.