preços do gpt-5.6 e custo de atendimento. custo de atendimento é quanto um usuário custa a cada vez que toca na sua funcionalidade de ia. os três níveis do gpt-5.6 permitem dividir essas chamadas, para que as baratas deixem de pagar preço de topo de linha. esta é a leitura de um dono de produto sobre a fatura, não a leitura de um engenheiro sobre o modelo.
em 26 de junho de 2026, a OpenAI lançou a família gpt-5.6: sol, terra e luna. a luna custa $1 de entrada / $6 de saída por 1 milhão de tokens. a sol custa $5 / $30. isso é uma diferença de 5x na mesma superfície de produto, segundo a finout.
se você lidera produto numa saas em série b com uma funcionalidade de ia voltada ao cliente, essa diferença é a sua próxima revisão financeira. a pergunta não é qual modelo é mais inteligente. a pergunta é quais chamadas realmente precisam da sol, e quais estão pagando a mais por ela sem ninguém perceber.
#para que serve, de fato, o nível luna do gpt-5.6?
o que é o nível luna do gpt-5.6 e quão barato ele é?
a luna é o mais barato dos três níveis do gpt-5.6 da OpenAI, lançado em 26 de junho de 2026 a $1 de entrada e $6 de saída por 1 milhão de tokens, contra $5 / $30 da sol — uma diferença de 5x. a OpenAI direciona a luna para classificação, roteamento de intenção e resumo: as chamadas de alto volume e baixo raciocínio por trás da maioria das funcionalidades de ia.
a maioria das funcionalidades de ia voltadas ao cliente não é uma única tarefa. é um monte de pequenas tarefas escondidas atrás de um botão só. marcar esta mensagem. encaminhar para o fluxo certo. resumir a conversa. e, às vezes, de fato raciocinar sobre um caso difícil.
as três primeiras são exatamente o que a luna foi precificada para fazer. a quarta é para o que você mantém a sol. se cada uma dessas chamadas atualmente vai parar no seu modelo de topo de linha, cerca de 80% do seu volume de tokens está pagando 5x mais do que precisa.
#quanto a divisão por níveis realmente tira da fatura?
pegue uma funcionalidade que produz 10 milhões de tokens de saída por mês, dos quais 80% são roteamento, marcação e resumo. só na sol, essa saída custa $300 mil por mês. mova os 80% para a luna e o mesmo trabalho custa $88 mil. as chamadas de raciocínio permanecem na sol, intactas, porque é ali que a qualidade precisa se manter.
o usuário não percebe diferença nenhuma. a marcação continua acontecendo, o resumo continua legível, a pergunta difícil continua recebendo a boa resposta. a única coisa que mudou é qual nível cobrou por qual chamada.
#o cache também muda a conta?
sim, e ele se soma. o gpt-5.6 mantém um desconto de 90% na entrada em cache, com pontos de corte de cache explícitos e vida mínima de cache de 30 minutos, segundo a eesel, em 26 de junho de 2026. as gravações em cache são cobradas a 1,25x, então o custo pontual é pequeno.
o seu prompt de sistema é o mesmo em toda chamada. é essa a parte que você coloca em cache. para uma funcionalidade que envia um bloco de instruções de 2 mil tokens em cada requisição, colocar isso em cache tira 90% dessa fatia de entrada, além do nível para o qual você já encaminhou a chamada.
we are
a stennir é uma consultoria de ia que entrega a camada de roteamento para que a sua funcionalidade leia cada chamada e envie o trabalho barato para a luna e o raciocínio de verdade para a sol.
we aren't
a stennir não é uma revendedora que troca o id do seu modelo pelo nível mais barato e torce para que a qualidade sobreviva.
#é preciso reconstruir a funcionalidade para conseguir isso?
não. nossas construções de ia para produto já dividem o tráfego por tarefa. roteamento, marcação e moderação vão para o nível barato. o raciocínio vai para o topo de linha. então um novo nível como a luna é uma mudança de configuração na faixa barata, não uma reconstrução da funcionalidade da qual seus usuários dependem.
se a sua funcionalidade hoje envia tudo para um único modelo, essa é a lacuna a fechar primeiro. a divisão é um ou dois dias de trabalho. a economia se acumula a cada mês em que o seu uso cresce.
nosso cfo não perguntou qual modelo usávamos. ele perguntou quanto um usuário ativo nos custa. a divisão por níveis foi a resposta que permitiu à funcionalidade sobreviver à revisão.
isso está dentro da nossa prática de consultoria, e o journal tem as provas de funcionalidades que já levamos à produção. se você quer os seus próprios números antes da próxima revisão financeira, agende uma chamada de discovery de 30 min e caminharemos com você pela divisão de tráfego da sua funcionalidade.