| GPT-5 Codex | Claude Opus 4.7 | |
|---|---|---|
| arenaElo | 1395 | 1420 |
| humanEval | 94.8 | 93.1 |
| sweBench | 68 | 64.3 |
| mmlu | 87.2 | 92.3 |
| gpqa | 58.4 | 65.2 |
| aime | 85 | 88 |
| Precio in/out ($/M) | $8 / $32 | $15 / $75 |
GPT-5 Codex lidera HumanEval por un pelo (94.8 vs 93.1) y es más barato. Opus 4.7 tiene más contexto (1M vs 400K) y mejor estabilidad de agente en ejecuciones de horas. Para PRs puntuales, Codex. Para refactors a nivel repo y agentes, Opus.
GPT-5 Codex · Claude Opus 4.7 · Todas las comparativas de IA