Claude Mythos marcó cifras state-of-the-art en cada benchmark frontera compartido que Anthropic publicó en abril de 2026: 93,9% en SWE-bench Verified, 94,6% en GPQA Diamond, 97,6% en USAMO 2026, 82,0% en Terminal-Bench 2.0 y un 100% pass@1 saturado en Cybench. Esta página es la referencia técnica para cada puntuación, qué mide realmente y por qué importa.
Actualizado: 9 de mayo de 2026
SWE-bench Verified es un subconjunto curado de 500 issues reales de GitHub revisados por mantenedores para garantizar un entorno de test limpio. El modelo recibe el issue, el repo y una suite de tests oculta; debe entregar un parche que haga pasar la suite. Mythos resuelve el 93,9% de extremo a extremo. Opus 4.6 estaba en 53,4%; son 40,5 puntos de salto en la misma evaluación, la mayor mejora intergeneracional registrada en este benchmark.
SWE-bench Pro es el primo más difícil y resistente a contaminación de SWE-bench Verified: los issues vienen de repos privados que no estaban en el corpus de entrenamiento. Mythos llega al 77,8%, superando a GPT-5.4 (el anterior rey con 57,7%) por 20,1 puntos. Esa brecha es lo que hace que los socios de Project Glasswing acepten desplegar Mythos en parches que de otro modo necesitarían un ingeniero senior.
GPQA Diamond contiene 198 preguntas de opción múltiple en física, química y biología validadas por doctorados de cada dominio para que sean difíciles incluso con acceso a internet para no expertos. Mythos resuelve el 94,6%, por encima del 90%, donde cada punto adicional tiene más que ver con la resolución del test que con la capacidad. OpenAI o4 era el líder previo con 87,1%; GPT-5.5 queda más atrás en 68,7%.
La USA Mathematical Olympiad es una competición de seis problemas donde las soluciones se valoran por rigor de la prueba, no por la respuesta final. USAMO 2026 se celebró en marzo de 2026: problemas nuevos sin contaminación plausible de entrenamiento. Mythos sacó 97,6%, en territorio de medalla de oro. Opus 4.6 estaba en 42,3%; GPT-5.4 en 95,2%.
Terminal-Bench 2.0 mide el rendimiento de agente end-to-end en 156 tareas reales de shell, desde upgrades de paquetes hasta análisis forense de logs. El modelo debe planificar, correr comandos, observar stdout, recuperarse de errores y verificar éxito. Mythos llega al 82,0% frente al 75,1% de GPT-5.4, una brecha significativa porque el benchmark premia razonamiento de largo recorrido en vez de acierto a un disparo.
CyberGym es el benchmark estándar para razonamiento ofensivo de ciberseguridad (tareas estilo CTF, encadenado de exploits); Cybench prueba razonamiento defensivo (análisis de vulnerabilidades, respuesta a incidentes). Mythos saca 83,1% en CyberGym (Opus 4.6 estaba en 66,6%) y 100% pass@1 en Cybench, saturándolo formalmente. Este cluster de resultados desencadenó la política de acceso controlado de Project Glasswing.
Los benchmarks de contexto largo suelen derrumbarse pasados 200K tokens: los scores de aguja-en-pajar se mantienen, pero el razonamiento sobre el pajar entero no aguanta. GraphWalks BFS pide al modelo recorrer en anchura un dump de grafo de 1M tokens y responder a queries de alcanzabilidad. Mythos llega al 80% frente al 21,4% de GPT-5.4 y ~14% de Opus 4.7. Es la métrica que justifica usar Mythos en agentes de refactor a nivel repo.
Anthropic ploteó Mythos contra la curva de rendimiento de 18 meses para modelos frontera, el ritmo medio al que mejoran los scores SOTA generación a generación. Mythos está 4,3× por encima de donde la curva predecía que estaría la capacidad en abril de 2026. Eso queda fuera de cualquier lanzamiento individual posterior a GPT-4; el único salto comparable fue GPT-3 a GPT-4 en marzo de 2023.
No directamente. El acceso a Mythos está cerrado tras Project Glasswing. Anthropic publicó la metodología de evaluación en el system card de 244 páginas; los socios reportan cifras coherentes con las titulares.
USAMO 2026 se celebró semanas antes de la evaluación, así que la contaminación no es plausible. SWE-bench Pro y GPQA Diamond están auditados por contaminación. El system card señala ~8% de contaminación de chain-of-thought en el entrenamiento RL pero no en las evals públicas reportadas aquí.
Saturado significa que el benchmark se ha quedado sin margen: el modelo acierta todo en pass@1. Anthropic y la comunidad de investigación tratan ya Cybench como retirado; el siguiente benchmark de razonamiento defensivo se espera para finales de 2026.