| Claude Mythos | Claude Sonnet 4.6 | |
|---|---|---|
| arenaElo | 1478 | 1358 |
| humanEval | 98.7 | 89 |
| sweBench | 93.9 | 60 |
| mmlu | 94.2 | 88.7 |
| gpqa | 94.6 | 59.4 |
| aime | 97.6 | 80 |
| Precio in/out ($/M) | $25 / $125 | $3 / $15 |
Trabajos completamente distintos: Sonnet 4.6 es el default de producción (disponible para todos, 3$ / 15$ por M tokens, latencia sub-segundo para UX de chat). Mythos es una preview de investigación frontera tras Project Glasswing a 25$ / 125$, usado sobre todo para ciberseguridad autónoma y razonamiento de nivel doctorado. Casi ningún equipo debería elegir Mythos cuando Sonnet 4.6 sirve; casi ninguno debería elegir Sonnet cuando la tarea pide Mythos.
Claude Mythos · Claude Sonnet 4.6 · Todas las comparativas de IA