| Grok 4 Heavy | OpenAI o4 | |
|---|---|---|
| arenaElo | 1391 | 1438 |
| humanEval | 88.4 | 94 |
| sweBench | 55 | 72 |
| mmlu | 89.3 | 92.5 |
| gpqa | 74.5 | 87.1 |
| aime | 92 | 94 |
| Precio in/out ($/M) | $15 / $60 | $12 / $48 |
o4 es más limpio en GPQA y tiene un ecosistema más estrecho. El modo debate multi-agente de Grok 4 Heavy gana ocasionalmente a o4 en evals tipo Humanity's Last Exam pero cuesta más por respuesta. Para razonamiento en producción, o4. Para benchmarks de investigación, cualquiera.