| Claude Mythos | GPT-5.5 | |
|---|---|---|
| arenaElo | 1478 | 1432 |
| humanEval | 98.7 | 94.2 |
| sweBench | 93.9 | 66 |
| mmlu | 94.2 | 93 |
| gpqa | 94.6 | 68.7 |
| aime | 97.6 | 92 |
| Precio in/out ($/M) | $25 / $125 | $12 / $48 |
Mythos supera a GPT-5.5 en todos los benchmarks compartidos: SWE-bench Verified (93,9% vs 65,1%), GPQA Diamond (94,6% vs 68,7%) y HumanEval (98,7% vs 94,2%). GPT-5.5 gana en disponibilidad: está disponible para todo el mundo con audio nativo, mientras Mythos está bloqueado tras Project Glasswing. Para productos cara al consumidor o de voz, GPT-5.5 es la única opción realista. Para seguridad defensiva e investigación matemática donde puedas asegurar acceso, Mythos juega en otra categoría.