GPT-5.6 explicado: modelos Sol, Terra y Luna, precios y benchmarks
El 9 de julio de 2026, OpenAI lanzó públicamente GPT-5.6, su nueva generación de modelos insignia, tras una preview de dos semanas limitada a partners verificados de API y Codex que arrancó el 26 de junio. El lanzamiento sustituye el clásico modelo único por una familia de tres gamas, sol, Terra y Luna. El cambio de nombres importa, el número (5.6) marca la generación, mientras que Sol, Terra y Luna son gamas de capacidad duraderas pensadas para persistir y mejorar en generaciones futuras. Sol es el flagship frontier para el razonamiento y trabajo agéntico más difícil, Terra es el modelo equilibrado del día a día y Luna es la opción rápida y más barata para tráfico de alto volumen. En esta guía desglosamos para qué sirve cada gama, los precios, los benchmarks publicados hasta ahora, las nuevas funciones agénticas como el modo Ultra con subagentes, y qué significa todo esto si construyes software o agentes de IA sobre estos modelos.
Sol, Terra y Luna, las Tres Gamas
GPT-5.6 llega como tres modelos que comparten generación pero apuntan a cargas de trabajo muy distintas:
- GPT-5.6 Sol (flagship), orientado a razonamiento difícil, coding agéntico, ciencia, ciberseguridad y flujos multi-paso complejos. Añade un ajuste de esfuerzo de razonamiento máximo y un modo Ultra que orquesta subagentes para tareas de largo recorrido. Precio: 5 $ por millón de tokens de entrada y 30 $ por millón de salida.
- GPT-5.6 Terra (equilibrado). El modelo por defecto para el trabajo profesional diario y el destino de enrutamiento de la mayoría del tráfico. OpenAI lo posiciona con capacidad similar a GPT-5.5 a 2,50 $ por millón de tokens de entrada y 15 $ por millón de salida.
- GPT-5.6 Luna (rápido y barato), pensado para tareas de alto volumen, borradores, extracción, clasificación y tráfico sensible a la latencia, a 1 $ por millón de tokens de entrada y 6 $ por millón de salida.
Benchmarks, lo Publicado Hasta Ahora
OpenAI enmarca las mejoras de GPT-5.6 en el trabajo agéntico de largo recorrido, mejor coding, y resultados notablemente más fuertes en genómica, biología cuantitativa y tareas de ciberseguridad. Las cifras publicadas más destacadas vienen de Terminal-Bench 2.1, que mide flujos de agente en línea de comandos:
Dos matices importantes antes de sacar conclusiones. Primero, OpenAI no ha publicado resultados de SWE-Bench Pro para Sol en el lanzamiento, y es el benchmark que la mayoría de equipos usa para comparar coding agéntico real. Segundo, la afirmación tan repetida de una ventana de contexto de 1,5 millones de tokens solo aparece en blogs agregadores de terceros y no está confirmada en ninguna página oficial de OpenAI, así que trátala como no verificada.
- GPT-5.6 Sol Ultra: 91,9% en Terminal-Bench 2.1 (Sol en modo Ultra con subagentes)
- GPT-5.6 Sol: 88,8% en Terminal-Bench 2.1 (gama flagship, modo estándar)
- GPT-5.6 Terra: 84,3% en Terminal-Bench 2.1 (gama equilibrada)
- GPT-5.6 Luna: 84,3% en Terminal-Bench 2.1 (gama rápida, iguala a Terra en este benchmark)
Precios y Prompt Caching
La escalera de precios es agresiva, sobre todo por abajo. Luna rebaja con mucho margen a la mayoría de competidores de gama frontier. Sobre las tarifas base, OpenAI aplica su economía de caché habitual:
- Tarifas base por millón de tokens, sol: 5 $ entrada / 30 $ salida. Terra: 2,50 $ entrada / 15 $ salida. Luna: 1 $ entrada / 6 $ salida.
- Escrituras de caché a 1,25x, escribir un prompt en la caché cuesta 1,25 veces la tarifa de entrada sin caché, así que cachear compensa a partir del segundo uso.
- 90% de descuento en lecturas cacheadas, los tokens de entrada cacheados se facturan con un 90% de descuento, decisivo para agentes y asistentes que reutilizan system prompts largos.
- Vida mínima de caché de 30 minutos, las entradas de caché viven al menos 30 minutos con breakpoints explícitos, suficiente para la mayoría de sesiones interactivas y pipelines batch.
Disponibilidad y el Calendario de Julio de 2026
GPT-5.6 aterriza en mitad de un mes intenso para OpenAI. La secuencia hasta ahora. El 12 de junio se retiraron los modelos GPT-5.2 de ChatGPT, migrando las conversaciones a GPT-5.5. El 26 de junio GPT-5.6 entró en preview limitada para partners seleccionados de API y Codex. El 8 de julio OpenAI lanzó GPT-Live, un modelo de voz full-duplex que sustituye la experiencia de ChatGPT Voice por defecto. Y el 9 de julio GPT-5.6 alcanzó la disponibilidad general pública.
Durante la preview, GPT-5.6 estuvo disponible solo por API y Codex, sin acceso en ChatGPT ni registro público. Con el lanzamiento del 9 de julio la disponibilidad se expande globalmente, así que cabe esperar el habitual despliegue escalonado por planes de ChatGPT y cuentas de API durante los días siguientes.
Qué Cambia GPT-5.6 en la Práctica
Más allá de la carrera de benchmarks, tres cosas destacan para los equipos que construyen software sobre estos modelos:
- El tiering ya es la arquitectura por defecto, con Sol, Terra y Luna compartiendo generación, OpenAI te está diciendo que enrutes, el tráfico barato a Luna, el trabajo diario a Terra y solo los problemas más difíciles a Sol. Las arquitecturas de modelo único dejan dinero sobre la mesa.
- Las funciones agénticas pasan a la plataforma, el modo Ultra con subagentes, el computer use y los flujos de línea de comandos ya son funciones de producto de primera clase, no hacks de la comunidad. Los agentes autónomos de larga ejecución son cada vez más fáciles de construir y más difíciles de diferenciar solo por la fontanería.
- Las gamas duraderas simplifican las migraciones, como Sol, Terra y Luna están pensadas para persistir entre generaciones, las futuras migraciones deberían parecerse más a subir una versión que a re-arquitecturar, siempre que tu código trate el modelo como una dependencia configurable.
Cómo Evaluamos Modelos Nuevos en Alher Tech
Cada lanzamiento de modelo llega envuelto en números de marketing. Nosotros llevamos agentes de IA y automatizaciones a producción, así que nuestro trabajo es separar lo que un lanzamiento cambia de verdad de lo que solo anuncia.
Si estás decidiendo si GPT-5.6 encaja en tu stack, podemos ejecutar esa evaluación sobre tus casos de uso reales y diseñar la arquitectura en función de la respuesta.
- Evals sobre tus tareas reales, comparamos los modelos nuevos como GPT-5.6 cara a cara con los actuales sobre los prompts y flujos reales de cada cliente antes de recomendar un cambio. Los benchmarks del día de lanzamiento rara vez predicen tu carga de trabajo.
- Enrutamiento inteligente entre gamas, la división Sol, Terra y Luna encaja directamente con las arquitecturas de enrutamiento que construimos, el modelo más barato que pasa el eval atiende cada petición, y solo el tráfico más difícil paga precio de flagship.
- Sin apuestas a un solo proveedor. La suspensión de Claude Fable 5 en junio mostró qué pasa con los productos hardcodeados a un modelo. Diseñamos arquitecturas multi-proveedor con fallbacks para que un incidente del vendor nunca sea tu caída.
- Guardrails antes que autonomía, funciones como el modo Ultra con subagentes son potentes, pero los agentes en producción necesitan herramientas en sandbox, topes de gasto y aprobación humana en acciones irreversibles antes de ejecutarse sin supervisión.
Conclusión
GPT-5.6 va menos de un gran modelo y más de una escalera de precios y capacidades, sol para el trabajo agéntico más difícil, Terra para el día a día, Luna para el volumen. Los números publicados de Terminal-Bench son fuertes, pero la ausencia de SWE-Bench Pro y la ventana de contexto sin confirmar hacen que la foto completa tarde unas semanas en emerger.
Para las empresas, la lección práctica es arquitectónica. El tiering de modelos y el enrutamiento son ya la forma por defecto de consumir IA frontier, y los equipos que traten los modelos como dependencias evaluadas e intercambiables capturarán las bajadas de precio sin el dolor de las migraciones.
Si quieres ayuda para evaluar GPT-5.6 frente a tu stack actual, o estás planificando un agente de IA o una automatización sobre él, es exactamente lo que hacemos para nuestros clientes.
Artículos relacionados
- GPT-5.6 vs Claude Fable 5, benchmarks, Precios y Cuál Usar
- Qué Significa GPT-5.6 para Tu Negocio, agentes de IA, Costes y Casos de Uso
- Claude Opus 4.8, novedades, Benchmarks, Precio y Cómo Usarlo