Claude Mythos vs Kimi K2: Gama Capybara cerrada vs frontera APAC abierta

Claude MythosKimi K2
arenaElo14781384
humanEval98.790.1
sweBench93.965.8
mmlu94.289.1
gpqa94.664.7
aime97.670
Precio in/out ($/M)$25 / $125$0.5 / $2

Nuestro veredicto

Kimi K2 de Moonshot AI es el modelo open-weights más capaz, con contexto de 2M y escritura largo-formato sólida. Mythos supera a K2 por ~30 puntos en GPQA y ~9 en HumanEval, además de capacidades de ciberseguridad que K2 no tiene. K2 gana en precio (~50× más barato en entrada), pesos abiertos y cobertura de lenguas APAC. Usa K2 cuando necesites contexto largo autoalojado con razonamiento frontera; ve a Mythos cuando lo único que importa es capacidad bruta.

Claude Mythos · Kimi K2 · Todas las comparativas de IA