Claude Mythos vs OpenAI o4: Comparativa entre campeones del razonamiento

Claude MythosOpenAI o4
arenaElo14781438
humanEval98.794
sweBench93.972
mmlu94.292.5
gpqa94.687.1
aime97.694
Precio in/out ($/M)$25 / $125$12 / $48

Nuestro veredicto

o4 era el rey de GPQA con 87,1%, hasta que Mythos marcó 94,6% en el mismo benchmark y 97,6% en USAMO 2026 (frente a ~90% de o4). La diferencia: o4 es un modelo de razonamiento público que puedes llamar hoy, mientras Mythos es por invitación. Si necesitas un monstruo de razonamiento que puedas desplegar este trimestre, o4 es la respuesta. Si estás dentro de Project Glasswing, Mythos es sencillamente el razonador más capaz que se ha publicado.

Claude Mythos · OpenAI o4 · Todas las comparativas de IA