| OpenAI o3 | Claude Opus 4.7 | |
|---|---|---|
| arenaElo | 1418 | 1420 |
| humanEval | 92.4 | 93.1 |
| sweBench | 69.1 | 64.3 |
| mmlu | 90.2 | 92.3 |
| gpqa | 83.3 | 65.2 |
| aime | 91.6 | 88 |
| Precio in/out ($/M) | $2 / $8 | $5 / $25 |
o3 razona mejor en GPQA (83.3 vs 65.2) pero piensa varios segundos o minutos por respuesta. Claude Opus 4.7 es más rápido, tiene 5× más contexto y mayor fiabilidad en agentes de largo recorrido. Elige o3 para problemas difíciles puntuales; Opus 4.7 para agentes interactivos y código que debe entregarse.