| Claude Mythos | Kimi K2 | |
|---|---|---|
| arenaElo | 1478 | 1384 |
| humanEval | 98.7 | 90.1 |
| sweBench | 93.9 | 65.8 |
| mmlu | 94.2 | 89.1 |
| gpqa | 94.6 | 64.7 |
| aime | 97.6 | 70 |
| Precio in/out ($/M) | $25 / $125 | $0.5 / $2 |
Kimi K2 de Moonshot AI es el modelo open-weights más capaz, con contexto de 2M y escritura largo-formato sólida. Mythos supera a K2 por ~30 puntos en GPQA y ~9 en HumanEval, además de capacidades de ciberseguridad que K2 no tiene. K2 gana en precio (~50× más barato en entrada), pesos abiertos y cobertura de lenguas APAC. Usa K2 cuando necesites contexto largo autoalojado con razonamiento frontera; ve a Mythos cuando lo único que importa es capacidad bruta.