precios de gpt-5.6 y costo de servicio. el costo de servicio es lo que te cuesta un usuario cada vez que usa tu función de ia. los tres niveles de gpt-5.6 te permiten dividir esas llamadas, de modo que las baratas dejen de pagar precios de nivel insignia. esta es la lectura de la factura desde la perspectiva de quien dirige el producto, no la lectura del modelo desde la perspectiva de un ingeniero.
el 26 de junio de 2026, OpenAI lanzó la familia gpt-5.6: sol, terra y luna. luna cuesta $1 de entrada / $6 de salida por 1m de tokens. sol cuesta $5 / $30. eso es una diferencia de 5 veces en la misma superficie de producto, según reportó finout.
si lideras producto en una saas de serie b con una función de ia de cara al cliente, esa diferencia es tu próxima revisión financiera. la pregunta no es qué modelo es más inteligente. la pregunta es qué llamadas realmente necesitan sol, y cuáles han estado pagando de más sin que nadie lo note.
#¿para qué sirve realmente el nivel luna de gpt-5.6?
¿qué es el nivel luna de gpt-5.6 y qué tan barato es?
luna es el más barato de los tres niveles de gpt-5.6 de openai, lanzado el 26 de junio de 2026 a $1 de entrada y $6 de salida por 1m de tokens, frente a los $5 / $30 de sol: una diferencia de 5 veces. openai orienta luna a clasificación, enrutamiento de intención y resumen: las llamadas de alto volumen y bajo razonamiento que hay detrás de la mayoría de las funciones de ia.
la mayoría de las funciones de ia de cara al cliente no son una sola tarea. son un montón de tareas pequeñas disfrazadas de un solo botón. etiquetar este mensaje. enrutarlo al flujo correcto. resumir el hilo. y, a veces, razonar de verdad sobre un caso difícil.
las primeras tres son exactamente para lo que está pensado el precio de luna. la cuarta es para lo que conservas sol. si cada una de esas llamadas hoy pasa por tu modelo insignia, aproximadamente el 80% de tu volumen de tokens está pagando 5 veces más de lo necesario.
#¿cuánto le quita realmente a la factura dividir por niveles?
toma una función que genera 10m de tokens de salida al mes, donde el 80% de eso es enrutamiento, etiquetado y resumen. usando solo sol, esa salida cuesta $300k al mes. mueve ese 80% a luna y el mismo trabajo cuesta $88k. las llamadas de razonamiento se quedan en sol, sin tocar, porque ahí es donde la calidad tiene que sostenerse.
el usuario no nota ninguna diferencia. la etiqueta sigue apareciendo, el resumen se sigue leyendo bien, la pregunta difícil sigue recibiendo la buena respuesta. lo único que cambió es qué nivel facturó cada llamada.
#¿el cacheo también cambia las cuentas?
sí, y se acumula. gpt-5.6 mantiene un descuento del 90% en la entrada cacheada, con puntos de corte de caché explícitos y una vida mínima de caché de 30 minutos, según eesel el 26 de junio de 2026. las escrituras en caché se facturan a 1.25x, así que el costo único es pequeño.
tu system prompt es igual en cada llamada. esa es la parte que cacheas. para una función que envía un bloque de instrucciones de 2k tokens en cada solicitud, cachearlo le quita el 90% a esa porción de entrada, sumado a cualquier nivel al que hayas enrutado la llamada.
we are
stennir es una consultora de ia que entrega la capa de enrutamiento para que tu función lea cada llamada y envíe el trabajo barato a luna y el razonamiento real a sol.
we aren't
stennir no es un revendedor que cambia el id de tu modelo al nivel más barato y espera que la calidad sobreviva.
#¿hay que reconstruir la función para conseguir esto?
no. nuestros builds de ia para producto ya dividen el tráfico por tarea. el enrutamiento, el etiquetado y la moderación van al nivel barato. el razonamiento va al insignia. así que un nivel nuevo como luna es un cambio de configuración en el carril barato, no una reconstrucción de la función de la que dependen tus usuarios.
si hoy tu función envía todo a un solo modelo, esa es la brecha que hay que cerrar primero. la división es uno o dos días de trabajo. el ahorro se acumula cada mes que crece tu uso.
nuestro cfo no preguntó qué modelo usábamos. preguntó cuánto nos cuesta un usuario activo. la división por niveles fue la respuesta que le permitió a la función sobrevivir la revisión.
esto forma parte de nuestra práctica de consultoría, y el blog tiene las pruebas de funciones que ya llevamos a producción. si quieres tus propios números antes de la próxima revisión financiera, agenda una llamada de descubrimiento de 30 min y revisamos contigo la división del tráfico de tu función.