| Kimi K3 | Kimi K2 | |
|---|---|---|
| arenaElo | 1478 | 1384 |
| humanEval | 96.5 | 90.1 |
| sweBench | 75.5 | 65.8 |
| mmlu | 94 | 89.1 |
| gpqa | 87.5 | 64.7 |
| aime | 92 | 70 |
| Precio in/out ($/M) | $3 / $15 | $0.57 / $2.3 |
K3 es un salto generacional: 2,8T de parámetros frente a 1T, aproximadamente 2,5x de eficiencia de escalado, razonamiento siempre activo y coding de clase frontier (SWE-Bench Pro 70,0 vs 56,0). K2 conserva dos ventajas, contexto de 2M (vs 1M) y tokens mucho más baratos (0,5$/2$ vs 3$/15$). Para agentes, coding y razonamiento difícil, K3. Para pipelines masivos de documentos largos con presupuesto ajustado, K2 sigue ganándose el puesto.