| GPT-5.5 | GPT-4o | |
|---|---|---|
| arenaElo | 1432 | 1345 |
| humanEval | 94.2 | 90.2 |
| sweBench | 66 | 33 |
| mmlu | 93 | 88.7 |
| gpqa | 68.7 | 53.6 |
| aime | 92 | 42 |
| Precio in/out ($/M) | $12 / $48 | $2.5 / $10 |
GPT-5.5 supera a GPT-4o en todos los benchmarks por doble dígito y tiene 4.5× más contexto. GPT-4o solo sigue siendo relevante para pipelines que dependen del stack de voz de la Realtime API. Los proyectos nuevos deberían arrancar en GPT-5.5.