| Claude Mythos | GPT-5.4 Codex | |
|---|---|---|
| arenaElo | 1478 | 1408 |
| humanEval | 98.7 | 95.5 |
| sweBench | 93.9 | 70 |
| mmlu | 94.2 | 88.6 |
| gpqa | 94.6 | 60.8 |
| aime | 97.6 | 86 |
| Precio in/out ($/M) | $25 / $125 | $9 / $36 |
GPT-5.4 Codex tenía la corona de HumanEval con 95,5%. Mythos la sube a 98,7% y marca 93,9% en SWE-bench Verified, resolviendo casi 19 de cada 20 issues reales de GitHub de extremo a extremo. Codex sigue disponible en un CLI usable hoy, se integra con Codex cloud y cuesta ~3× menos por token. Para agencias y equipos SaaS que entregan código en producción este trimestre, Codex sigue siendo la elección práctica. Mythos es la respuesta correcta cuando la fiabilidad de SWE-bench importa más que la disponibilidad.
Claude Mythos · GPT-5.4 Codex · Todas las comparativas de IA