| Claude Opus 4.8 | GPT-5.5 | |
|---|---|---|
| arenaElo | 1435 | 1432 |
| humanEval | 94.5 | 94.2 |
| sweBench | 67 | 66 |
| mmlu | 93 | 93 |
| gpqa | 67.5 | 68.7 |
| aime | 90 | 92 |
| Precio in/out ($/M) | $5 / $25 | $5 / $30 |
En coding agéntico Opus 4.8 lidera con 69,2% SWE-Bench Pro frente al 58,6% de GPT-5.5, y encabeza el benchmark Super-Agent como único modelo que completa todos los casos de principio a fin al mismo coste. Opus 4.8 es la elección para agentes autónomos de largo recorrido y computer-use; GPT-5.5 sigue siendo un todoterreno sólido si ya estás invertido en el stack de OpenAI. Como siempre, benchmark-ea ambos con tu carga real antes de decidir.