GPT-6 Sol y Luna: precios, prompt caching y cómo recalcular el costo de tus agentes
El 22 de septiembre de 2026 OpenAI lanzó GPT-6 Sol y GPT-6 Luna con precios de API 50% más bajos que los promocionales de sus antecesores de la serie GPT-5.6: Sol pasa de USD 4 a 2 por millón de tokens de entrada y de 20 a 10 de salida; Luna, de 0,20 a 0,10 de entrada y de 1,20 a 0,50 de salida. Junto con los modelos llegó un sistema de prompt caching renovado que, para agentes de larga duración, puede mover la factura tanto como el cambio de modelo.
Si tenés features con LLM en producción, este es un buen momento para rehacer las cuentas. Pero conviene hacerlas con la documentación oficial a mano, porque hay reglas de precio que cambian bastante el resultado.
Qué salió exactamente
Según el anuncio y la documentación de la API:
| Modelo | Entrada (USD/M) | Entrada cacheada | Salida (USD/M) | Pensado para |
|---|---|---|---|---|
gpt-6-sol |
2,00 | 0,20 | 10,00 | Coding complejo y flujos agénticos |
gpt-6-luna |
0,10 | 0,01 | 0,50 | Tareas acotadas y de alto volumen |
gpt-6-astra (referencia) |
10,00 | 1,00 | 50,00 | El modelo tope de la familia |
Otros datos de la ficha de Sol que importan para arquitectura:
- Contexto: 1.050.000 tokens y hasta 128.000 de salida.
- Razonamiento:
reasoning.effortaceptanone,low,medium(por defecto),high,xhighymax. - Function calling: en Chat Completions solo funciona con
reasoning_effortennone. Para combinar herramientas y razonamiento, la documentación recomienda la Responses API. - Disponibilidad: API, Codex y ChatGPT Work. Según el anuncio, todavía no en el Chat de ChatGPT.
Los benchmarks, con la advertencia de siempre
OpenAI publica comparaciones agresivas. En DeepSWE v1.1, Sol con esfuerzo max llega a 68,8%, a 1,1 puntos del mejor resultado de Claude Fable 5 (69,9% en xhigh), con un costo por tarea aproximadamente 80% menor. En OSWorld 2.0 offline, Sol en xhigh saca 60,5% contra 60,3% de Claude Opus 5 en medium.
Son números del propio vendor, y OpenAI aclara que los datos de competidores salen de reportes públicos (y que usó Fable 5 cuando no había resultados de Fable 5.1). Sirven como señal para decidir qué probar, no para decidir qué usar. Esa decisión se toma con tus propias evals.
El caching nuevo: la parte que más mueve la factura
OpenAI detalló los cambios en un post aparte:
- Mayor tasa de aciertos por defecto y descuento para prefijos compartidos reutilizados dentro de una ventana de 30 minutos. La lectura de caché cuesta 10% del precio de entrada.
- Dashboard y diagnóstico de cache misses. La herramienta compara un request con uno anterior y explica qué rompió la reutilización, por ejemplo:
{
"prompt_cache_diagnostics": {
"type": "cache_miss",
"reason": "tools_changed",
"comparison_reusable_tokens": 5629,
"cache_missed_tokens": 5629
}
}
- Breakpoints explícitos para elegir hasta dónde se cachea el prefijo.
- Cambiar el esfuerzo de razonamiento sin romper la caché, agregando un
configuration_update. - No quitar definiciones de herramientas: la recomendación es mantenerlas estables y usar
allowed_tools(otool_choice: none) para limitar cuáles se pueden llamar. - Prewarming: precargar instrucciones y herramientas al arrancar la aplicación.
GitHub, citado en el anuncio, dice que estas mejoras redujeron más de 50% la porción de tokens de prompt que Copilot necesita procesar desde cero.
Hagamos números (ejemplo ilustrativo)
Supongamos un agente que consume 10 millones de tokens de entrada y 2 millones de salida por día. Con precios de lista:
| Escenario | Cálculo | Costo diario |
|---|---|---|
| GPT-5.6 Sol (precio promocional) | 10 × 4 + 2 × 20 | USD 80 |
| GPT-6 Sol sin caché | 10 × 2 + 2 × 10 | USD 40 |
| GPT-6 Sol, 80% de la entrada cacheada | 8 × 0,20 + 2 × 2,50 + 2 × 10 | USD 26,60 |
| GPT-6 Luna sin caché | 10 × 0,10 + 2 × 0,50 | USD 2 |
En el escenario con caché asumimos el caso conservador: los 2 millones de tokens de entrada no cacheados se cobran como escritura de caché (USD 2,50, es decir 1,25 veces el precio de entrada). Aun así, la salida (USD 20) pasa a ser el costo dominante. Con estos precios, diseñar prompts que aprovechen la caché y controlar la longitud de las respuestas vale tanto como elegir el modelo.
La letra chica: el umbral de 272K tokens
La documentación de Sol y Luna dice que, si un request supera los 272.000 tokens de entrada, todo el request se cobra al doble en entrada y caché, y a 1,5 veces en salida.
Un request de 300.000 tokens de entrada y 10.000 de salida en Sol cuesta:
- Con recargo: 0,3 × 4 + 0,01 × 15 = USD 1,35
- Si hubiera quedado por debajo del umbral: 0,3 × 2 + 0,01 × 10 = USD 0,70
Tener un millón de tokens de contexto disponible no significa que convenga usarlo. Otros multiplicadores a tener en cuenta: Batch y Flex cuestan la mitad del precio estándar, Fast mode cuesta el doble y el procesamiento regional (residencia de datos) suma 10%.
Qué cambiar en tu arquitectura
- Routing por tarea. Luna para clasificar, extraer y resumir; Sol para agentes y código; Astra solo donde tus evals muestren que la diferencia se paga.
- Prefijo estable. System prompt y definiciones de herramientas primero, siempre en el mismo orden. Lo variable va al final, en modo append-only.
- Presupuesto de contexto por debajo de 272K, con compactación o chunking.
- Métrica de costo por tarea resuelta, no por token. Un modelo más barato que necesita tres intentos puede salir más caro.
- Una capa de abstracción entre tu aplicación y el proveedor, para que cambiar de modelo sea configuración y no un refactor.
Un chequeo simple para detectar requests que se acercan al umbral, usando el campo usage que devuelve la API:
UMBRAL = 272_000
def revisar_uso(response):
entrada = response.usage.input_tokens
if entrada > UMBRAL * 0.9:
# Registrar y alertar: este request está cerca del recargo (o ya lo pagó)
print(f"[alerta-costo] input_tokens={entrada}")
Qué hacer con esto
- Correr tus evals actuales contra Sol y Luna, midiendo calidad y costo por tarea.
- Abrir el dashboard de caching antes de tocar el modelo: es probable que haya cache misses evitables.
- Alertar en requests que se acerquen a 272K tokens de entrada.
- Revisar si alguna integración usa function calling con Chat Completions y razonamiento a la vez.
- Recordar que los precios cambian seguido: el mismo 28 de septiembre Anthropic lanzó Claude Sonnet 5.5, que presenta como más rápido y más barato que su antecesor. No te cases con un proveedor por el precio de este mes.
¿Ya medís el costo por tarea resuelta o seguís mirando el precio por millón de tokens?
Lecturas relacionadas
- DeepSeek V4.1 Flash: qué trae el modelo open-weight con licencia MIT y qué revisar antes de usar su API: un modelo open-weight con licencia MIT, precios por franja horaria y la letra chica de su Responses API.
- Observabilidad para apps con LLM: trazas, métricas y convenciones GenAI de OpenTelemetry: qué medir en una app con LLM (latencia, tokens, costo, errores) y cómo instrumentarla con OpenTelemetry.
- OpenAI pausó sus modelos más capaces: 6 lecciones de seguridad para equipos que usan agentes de IA: un agente que salió a internet por DNS, otro que filtró un token, y qué revisar en tus propios agentes.
Fuentes
- OpenAI, "Introducing GPT-6 Sol and Luna" (22/09/2026): https://openai.com/index/introducing-gpt-6-sol-and-luna/
- OpenAI, "Better prompt caching for GPT-6" (22/09/2026): https://openai.com/index/better-prompt-caching-for-gpt-6/
- OpenAI API docs, GPT-6 Sol: https://developers.openai.com/api/docs/models/gpt-6-sol
- OpenAI API docs, GPT-6 Luna: https://developers.openai.com/api/docs/models/gpt-6-luna
- OpenAI API docs, Pricing: https://developers.openai.com/api/docs/pricing
- OpenAI Developer Community, anuncio oficial (22/09/2026): https://community.openai.com/t/announcing-gpt-6-sol-and-gpt-6-luna-in-the-api-codex-and-chatgpt/1399925
- TechCrunch, "Anthropic releases Sonnet 5.5..." (28/09/2026): https://techcrunch.com/2026/09/28/anthropic-releases-sonnet-5-5-which-it-calls-a-significantly-cheaper-faster-work-partner/