prezzi di gpt-5.6 e costo di servizio. il costo di servizio è quanto ti costa un utente ogni volta che tocca la tua funzionalità ai. i tre livelli di gpt-5.6 ti permettono di dividere quelle chiamate, così quelle economiche smettono di pagare i prezzi del modello di punta. questa è la lettura della bolletta di chi gestisce il prodotto, non quella di un ingegnere sul modello.
il 26 giugno 2026, OpenAI ha rilasciato la famiglia gpt-5.6: sol, terra e luna. luna costa $1 in ingresso / $6 in uscita per 1m di token. sol costa $5 / $30. è un divario di 5 volte sulla stessa superficie di prodotto, come riportato da finout.
se guidi il prodotto in una saas series b con una funzionalità ai rivolta ai clienti, questo divario è la tua prossima revisione finanziaria. la domanda non è quale modello sia più intelligente. la domanda è quali chiamate hanno davvero bisogno di sol, e quali stanno pagando più del dovuto senza che nessuno se ne accorga.
#a cosa serve davvero il livello luna di gpt-5.6?
cos'è il livello luna di gpt-5.6 e quanto è economico?
luna è il più economico dei tre livelli gpt-5.6 di openai, lanciato il 26 giugno 2026 a $1 di input e $6 di output per 1m di token contro i $5 / $30 di sol — un divario di 5 volte. openai destina luna a classificazione, instradamento dell'intento e riassunto: le chiamate ad alto volume e basso ragionamento dietro la maggior parte delle funzionalità ai.
la maggior parte delle funzionalità ai rivolte ai clienti non è un solo compito. è un mucchio di piccoli compiti travestiti da un unico pulsante. etichetta questo messaggio. instradalo al flusso giusto. riassumi il thread. poi, a volte, ragiona davvero su un caso difficile.
i primi tre sono esattamente ciò per cui luna è pensato in termini di prezzo. il quarto è il motivo per cui tieni sol. se oggi ognuna di quelle chiamate finisce sul tuo modello di punta, circa l'80% del tuo volume di token sta pagando 5 volte più del necessario.
#quanto toglie davvero alla bolletta la divisione tra livelli?
prendi una funzionalità che genera 10m di token in output al mese, di cui l'80% è instradamento, etichettatura e riassunto. solo con sol, quell'output costa $300k al mese. sposta l'80% su luna e lo stesso lavoro costa $88k. le chiamate di ragionamento restano su sol, intatte, perché è lì che la qualità deve reggere.
l'utente non vede alcuna differenza. l'etichetta arriva comunque, il riassunto si legge comunque bene, la domanda difficile riceve comunque la risposta giusta. l'unica cosa cambiata è quale livello ha fatturato quale chiamata.
#anche la cache cambia i conti?
sì, e si somma. gpt-5.6 mantiene uno sconto del 90% sull'input in cache, con punti di interruzione della cache espliciti e una durata minima della cache di 30 minuti, secondo eesel del 26 giugno 2026. le scritture in cache vengono fatturate a 1,25x, quindi il costo una tantum è minimo.
il tuo system prompt è lo stesso a ogni chiamata. è quella la parte che metti in cache. per una funzionalità che invia un blocco di istruzioni da 2k token a ogni richiesta, metterlo in cache toglie il 90% da quella fetta di input, in aggiunta al livello a cui hai instradato la chiamata.
we are
stennir è una società di consulenza ai che costruisce lo strato di instradamento così la tua funzionalità legge ogni chiamata e manda il lavoro economico a luna e il ragionamento vero a sol.
we aren't
stennir non è un rivenditore che cambia l'id del tuo modello con il livello più economico sperando che la qualità regga.
#bisogna ricostruire la funzionalità per ottenere questo?
no. i nostri progetti ai for product dividono già il traffico per compito. instradamento, etichettatura e moderazione vanno al livello economico. il ragionamento va al modello di punta. quindi un nuovo livello come luna è una modifica di configurazione sulla corsia economica, non una ricostruzione della funzionalità da cui dipendono i tuoi utenti.
se oggi la tua funzionalità manda tutto a un solo modello, è questo il divario da colmare per primo. la divisione è un lavoro di uno o due giorni. il risparmio si accumula ogni mese in cui il tuo utilizzo cresce.
il nostro cfo non ha chiesto quale modello usassimo. ha chiesto quanto ci costa un utente attivo. la divisione tra livelli è la risposta che ha permesso alla funzionalità di superare la revisione.
questo rientra nella nostra pratica di consulenza, e il journal contiene le prove delle funzionalità che abbiamo già portato in produzione. se vuoi i tuoi numeri prima della prossima revisione finanziaria, prenota una call conoscitiva da 30 minuti e analizzeremo insieme la divisione del traffico della tua funzionalità.