journal

gpt-5.6-prijzen: wat luna's besparing van 5x betekent voor je cost-to-serve

openai's nieuwe gpt-5.6 luna-laag kost 5 keer minder dan sol. dit is wat dat verschil doet met de cost-to-serve van je ai-functie, nog voor de volgende financiële review.

omar f.applied ai & data··4 min lezen

gpt-5.6-prijzen en cost-to-serve. cost-to-serve is wat elke gebruiker je kost telkens wanneer die je ai-functie aanraakt. de drie lagen van gpt-5.6 laten je die aanroepen opsplitsen, zodat de goedkope niet langer de prijs van het topmodel betalen. dit is het perspectief van een product owner op de rekening, niet het perspectief van een engineer op het model.

op 26 juni 2026 bracht OpenAI de gpt-5.6-familie uit: sol, terra en luna. luna draait op $1 in / $6 uit per 1 miljoen tokens. sol draait op $5 / $30. dat is een verschil van 5 keer op hetzelfde productoppervlak, gemeld door finout.

als je product leidt bij een series-b-saas met een klantgerichte ai-functie, is dat verschil je volgende financiële review. de vraag is niet welk model het slimst is. de vraag is welke aanroepen sol echt nodig hebben, en welke stilletjes te veel ervoor betalen.

#waar is de luna-laag van gpt-5.6 eigenlijk voor bedoeld?

wat is de gpt-5.6 luna-laag en hoe goedkoop is die?

luna is de goedkoopste van openai's drie gpt-5.6-lagen, gelanceerd op 26 juni 2026 tegen $1 input en $6 output per 1 miljoen tokens, tegenover sol op $5 / $30 — een verschil van 5 keer. openai richt luna op classificatie, intentieroutering en samenvatting: de veelvoorkomende, weinig complexe aanroepen achter de meeste ai-functies.

de meeste klantgerichte ai-functies zijn geen enkele taak. het zijn een stapel kleine taken achter één knop. label dit bericht. stuur het naar de juiste flow. vat de thread samen. en dan, soms, denk echt na over een lastig geval.

de eerste drie zijn precies waar luna voor geprijsd is. de vierde is waarvoor je sol aanhoudt. als elk van die aanroepen nu op je topmodel terechtkomt, betaalt ruwweg 80% van je tokenvolume 5 keer meer dan nodig.

#hoeveel scheelt de laagsplitsing daadwerkelijk op de rekening?

neem een functie die 10 miljoen outputtokens per maand verwerkt, waarvan 80% routering, labeling en samenvatting is. alleen op sol kost die output $300k per maand. verplaats die 80% naar luna en hetzelfde werk kost $88k. de redeneeraanroepen blijven ongewijzigd op sol, want daar moet de kwaliteit overeind blijven.

de gebruiker merkt geen verschil. het label komt nog steeds goed aan, de samenvatting leest nog steeds vlot, de lastige vraag krijgt nog steeds het goede antwoord. het enige dat veranderde, is welke laag welke aanroep factureerde.

#verandert caching de rekensom ook?

ja, en het stapelt op. gpt-5.6 houdt een korting van 90% op gecachte input aan, met expliciete cachebreekpunten en een minimale cachelevensduur van 30 minuten, volgens eesel op 26 juni 2026. cache-writes worden gefactureerd tegen 1,25x, dus de eenmalige kost is klein.

je systeemprompt is bij elke aanroep hetzelfde. dat is het deel dat je cachet. voor een functie die bij elk verzoek een instructieblok van 2k tokens verstuurt, haalt caching 90% van dat deel van de input af, bovenop welke laag je de aanroep ook naartoe stuurde.

we are

stennir is een ai-consultancy die de routeringslaag bouwt zodat je functie elke aanroep leest en goedkoop werk naar luna stuurt en echt redeneerwerk naar sol.

we aren't

stennir is geen doorverkoper die je model-id vervangt door de goedkoopste laag en hoopt dat de kwaliteit standhoudt.

#moet je de functie herbouwen om dit te krijgen?

nee. onze ai voor product-builds splitsen verkeer nu al per taak. routering, labeling en moderatie gaan naar de goedkope laag. redeneerwerk gaat naar het topmodel. een nieuwe laag zoals luna is dus een configuratiewijziging op de goedkope baan, geen herbouw van de functie waar je gebruikers op vertrouwen.

als je functie nu alles naar één model stuurt, is dat het gat dat je als eerste moet dichten. de splitsing is een dag of twee werk. de besparing stapelt zich elke maand op naarmate je gebruik groeit.

onze cfo vroeg niet welk model we gebruikten. hij vroeg wat één actieve gebruiker ons kost. de laagsplitsing is het antwoord waarmee de functie de review overleefde.

product lead, series-b-saas (engagement onder nda)

dit valt onder onze consultancy-praktijk, en het journal heeft de bewijzen van functies die we al naar productie hebben gebracht. wil je je eigen cijfers voor de volgende financiële review, boek een discovery-gesprek van 30 min en we lopen samen met je door de verkeerssplitsing van je functie.

terug naar journal
productgpt-5.6ai newscost to servemodel pricing

vertel ons wat jeopgeleverd wilt hebben.

plan een gesprek van 30 min