| Claude Mythos | OpenAI o4 | |
|---|---|---|
| arenaElo | 1478 | 1438 |
| humanEval | 98.7 | 94 |
| sweBench | 93.9 | 72 |
| mmlu | 94.2 | 92.5 |
| gpqa | 94.6 | 87.1 |
| aime | 97.6 | 94 |
| Precio in/out ($/M) | $25 / $125 | $12 / $48 |
o4 era el rey de GPQA con 87,1%, hasta que Mythos marcó 94,6% en el mismo benchmark y 97,6% en USAMO 2026 (frente a ~90% de o4). La diferencia: o4 es un modelo de razonamiento público que puedes llamar hoy, mientras Mythos es por invitación. Si necesitas un monstruo de razonamiento que puedas desplegar este trimestre, o4 es la respuesta. Si estás dentro de Project Glasswing, Mythos es sencillamente el razonador más capaz que se ha publicado.