| GPT-5.4 Codex | Claude Opus 4.7 | |
|---|---|---|
| arenaElo | 1408 | 1420 |
| humanEval | 95.5 | 93.1 |
| sweBench | 70 | 64.3 |
| mmlu | 88.6 | 92.3 |
| gpqa | 60.8 | 65.2 |
| aime | 86 | 88 |
| Precio in/out ($/M) | $9 / $36 | $15 / $75 |
5.4 Codex mantiene la corona HumanEval (95.5 vs 93.1) y es más barato por token. Opus 4.7 compensa con 2.5× más de contexto y agentes de largo recorrido más fuertes. Pipelines especializados de código: Codex. Agentes de coding que también razonan y planifican: Opus.
GPT-5.4 Codex · Claude Opus 4.7 · Todas las comparativas de IA