| Kimi K2 | DeepSeek R1 | |
|---|---|---|
| arenaElo | 1384 | 1389 |
| humanEval | 90.1 | 90.2 |
| sweBench | 65.8 | 49.2 |
| mmlu | 89.1 | 90.8 |
| gpqa | 64.7 | 71.5 |
| aime | 70 | 79.8 |
| Precio in/out ($/M) | $0.5 / $2 | $0.55 / $2.19 |
R1 gana en razonamiento (GPQA 71.5 vs 64.7); Kimi K2 gana en contexto (2M vs 128K) y calidad de chat general. Para matemáticas y ciencia, R1. Para escritura larga, agentes y productos APAC, Kimi.