Claude Code vs GPT-5.4 Codex: Envoltorio de agente vs modelo puro

Claude CodeGPT-5.4 Codex
arenaElo14201408
humanEval93.195.5
sweBench64.370
mmlu92.388.6
gpqa65.260.8
aime8886
Precio in/out ($/M)$15 / $75$9 / $36

Nuestro veredicto

GPT-5.4 Codex puntúa más alto en HumanEval aislado, pero la orquestación, hooks y memoria de Claude Code le dan ventaja a Opus 4.7 en ejecuciones largas. Si tu flujo cabe en una CLI, Claude Code gana en tiempo real; si integras en tu propio harness, elige 5.4 Codex directamente.

Claude Code · GPT-5.4 Codex · Todas las comparativas de IA