| GPT-5.5 | OpenAI o4 | |
|---|---|---|
| arenaElo | 1432 | 1438 |
| humanEval | 94.2 | 94 |
| sweBench | 66 | 72 |
| mmlu | 93 | 92.5 |
| gpqa | 68.7 | 87.1 |
| aime | 92 | 94 |
| Precio in/out ($/M) | $12 / $48 | $12 / $48 |
o4 aplasta a GPT-5.5 en GPQA (87% vs 69%) pero piensa segundos o minutos por respuesta. GPT-5.5 gana en throughput cotidiano, multimodal y coste por interacción. Enruta razonamiento difícil a o4 y el resto a GPT-5.5.