| GPT-5 | DeepSeek R1 | |
|---|---|---|
| arenaElo | 1412 | 1389 |
| humanEval | 91.6 | 90.2 |
| sweBench | 65 | 49.2 |
| mmlu | 91.5 | 90.8 |
| gpqa | 63.8 | 71.5 |
| aime | 92 | 79.8 |
| Precio in/out ($/M) | $1.25 / $10 | $0.7 / $2.5 |
GPT-5 está más pulido, es multimodal y más fácil de integrar; DeepSeek R1 gana en razonamiento puro y cuesta ~5× menos por millón de tokens. La mayoría de equipos deberían ir por defecto con GPT-5; los que hagan razonamiento intensivo y cuiden coste deben testear DeepSeek.