| OpenAI o4 | Claude Opus 4.7 | |
|---|---|---|
| arenaElo | 1438 | 1420 |
| humanEval | 94 | 93.1 |
| sweBench | 72 | 64.3 |
| mmlu | 92.5 | 92.3 |
| gpqa | 87.1 | 65.2 |
| aime | 94 | 88 |
| Precio in/out ($/M) | $12 / $48 | $15 / $75 |
o4 es state-of-the-art en GPQA (87% vs 65%) y gana en matemáticas y ciencia a un disparo. Opus 4.7 corre más rápido, tiene 4× más contexto y supera a o4 en flujos agénticos de varias horas. Elige o4 para respuestas únicas difíciles; Opus 4.7 para agentes que deben entregar.