Claude Mythos
Actualizado: 9 de mayo de 2026
Especificaciones
| Proveedor | Anthropic |
|---|
| Lanzamiento | 8 de abril de 2026 |
|---|
| Contexto | 1M tokens |
|---|
| Entrada | $25 / M tokens |
|---|
| Salida | $125 / M tokens |
|---|
Benchmarks
| mmlu | 94.2 |
|---|
| gpqa | 94.6 |
|---|
| humanEval | 98.7 |
|---|
| arenaElo | 1478 |
|---|
| sweBench | 93.9 |
|---|
| sweBenchPro | 88 |
|---|
| liveCodeBench | 90 |
|---|
| aiderPolyglot | 90 |
|---|
| terminalBench | 65 |
|---|
| mmluPro | 91 |
|---|
| hle | 35 |
|---|
| aime | 97.6 |
|---|
| math500 | 99.5 |
|---|
| mmmu | 85 |
|---|
Puntos fuertes
- Frontera de fronteras: 93,9% en SWE-bench Verified, 97,6% en USAMO 2026, 94,6% en GPQA Diamond
- Salto de 4,3× sobre la curva de rendimiento previa; satura Cybench al 100% pass@1
- Contexto largo que realmente aguanta: 80% en GraphWalks BFS a 1M tokens frente al 21,4% de GPT-5.4
Debilidades
- Preview de investigación cerrado: solo socios de Project Glasswing y un puñado de operadores críticos validados reciben claves
- Precio de lista 5× superior a Opus 4.7 (25$ / 125$ por millón de tokens) cuando hay acceso
- Sin self-serve público: Anthropic ha dicho que no planea liberarlo de forma general
Ideal para
- Investigación defensiva de ciberseguridad a escala nacional (descubrimiento de zero-days y parcheo)
- Generación de pruebas matemáticas y razonamiento científico de nivel doctorado
- Agentes de coding de largo recorrido que necesitan razonar sobre un repo entero en una sola ventana
Comparar con otros modelos de IA