| DeepSeek V4 | GPT-5 | |
|---|---|---|
| arenaElo | 1395 | 1412 |
| humanEval | 91 | 91.6 |
| sweBench | 62 | 65 |
| mmlu | 91.5 | 91.5 |
| gpqa | 73 | 63.8 |
| aime | 90 | 92 |
| Precio in/out ($/M) | $1.74 / $3.48 | $1.25 / $10 |
En benchmarks de razonamiento DeepSeek V4 iguala o supera a GPT-5 (GPQA 73.0 vs 63.8) a una fracción del coste. GPT-5 mantiene la ventaja multimodal (audio) y de ecosistema de herramientas. El lanzamiento de V4 es la prueba más clara de que la inteligencia frontera se está convirtiendo en commodity, para cualquier equipo que controle su stack de inferencia, V4 es el nuevo default.