| OpenAI o1 | OpenAI o3 | |
|---|---|---|
| arenaElo | 1380 | 1418 |
| humanEval | 89.1 | 92.4 |
| sweBench | 48.9 | 69.1 |
| mmlu | 88.7 | 90.2 |
| gpqa | 78 | 83.3 |
| aime | 83.3 | 91.6 |
| Precio in/out ($/M) | $15 / $60 | $2 / $8 |
Aquí no hay ningún equilibrio que sopesar, lo cual es raro. o3 gana a o1 en absolutamente todas las métricas publicadas, incluidas SWE-bench Verified 69,1% frente a 48,9%, GPQA 83,3% frente a 78%, Aider Polyglot 79 frente a 61, Terminal-Bench 48 frente a 33 y Humanity's Last Exam 20,3% frente a 8,8%, y lo hace a 2$ / 8$ por M tokens frente a 15$ / 60$, más o menos la séptima parte. La ventana de contexto es la misma, 200K, y los dos aceptan texto e imagen, así que migrar no cambia nada de cómo lo llamas. Si en 2026 sigues pagando o1, estás pagando siete veces más por un modelo medible peor. Múdate.