| DeepSeek V4 | GPT-5 | |
|---|---|---|
| arenaElo | 1395 | 1412 |
| humanEval | 91 | 91.6 |
| sweBench | 62 | 65 |
| mmlu | 91.5 | 91.5 |
| gpqa | 73 | 63.8 |
| aime | 90 | 92 |
| Precio in/out ($/M) | $1.74 / $3.48 | $1.25 / $10 |
En benchmarks de razonamiento DeepSeek V4 iguala o supera a GPT-5 (GPQA 73.0 vs 63.8) a una fracción del coste. GPT-5 mantiene la ventaja multimodal (audio) y de ecosistema de herramientas. El lanzamiento de V4 es la prueba más clara de que la inteligencia frontera se está convirtiendo en commodity: para cualquier equipo que controle su stack de inferencia, V4 es el nuevo default.