GPT-5.6 定价与服务成本. 服务成本,是指每次用户触发你的 AI 功能时你要付出的成本。GPT-5.6 的三个档位让你把这些调用拆分开来计费,便宜的调用不用再按旗舰价格付费。这是产品负责人看账单的视角,不是工程师看模型的视角。
2026 年 6 月 26 日,OpenAI 发布了 GPT-5.6 系列:Sol、Terra 和 Luna。Luna 每 100 万 token 的价格是输入 1 美元、输出 6 美元。Sol 是 5 美元 / 30 美元。同一产品线上出现了 5 倍的价差,finout 对此做了报道。
如果你在一家 B 轮 SaaS 公司负责产品,且有面向客户的 AI 功能,这个价差就是你下一次财务复盘要面对的问题。问题不在于哪个模型最聪明,而在于哪些调用真的需要 Sol,哪些一直在悄悄多付冤枉钱。
#GPT-5.6 的 Luna 档位到底是为什么设计的?
GPT-5.6 的 Luna 档位是什么,价格有多便宜?
Luna 是 OpenAI 三个 GPT-5.6 档位中最便宜的一档,2026 年 6 月 26 日发布,每 100 万 token 输入 1 美元、输出 6 美元,而 Sol 是 5 美元 / 30 美元,两者相差 5 倍。OpenAI 把 Luna 定位于分类、意图路由和摘要生成,也就是大多数 AI 功能背后那些调用量大、推理要求低的任务。
大多数面向客户的 AI 功能其实不是一件事,而是一堆小任务披着同一个按钮的外衣。给这条消息打标签,把它路由到正确的流程,总结这段对话,偶尔才需要真正推理一个复杂的问题。
前三件正是 Luna 的定价所对应的任务,第四件才是你需要留住 Sol 的原因。如果这些调用目前全部打到你的旗舰模型上,大概 80% 的 token 用量都在多付本不需要的 5 倍价钱。
档位拆分实际能从账单上省下多少?
假设一个功能每月产生 1000 万输出 token,其中 80% 用于路由、打标签和摘要。如果全部用 Sol,这部分输出每月要花 30 万美元。把这 80% 转到 Luna,同样的工作只需 8.8 万美元。推理类调用继续留在 Sol 上不变,因为质量必须在这里守住。
用户感觉不到任何差别。标签照样打上,摘要照样可读,难题依然能得到好答案。唯一变化的是哪个档位为哪次调用计费。
缓存会不会也改变这笔账?
会,而且可以叠加。据 eesel 在 2026 年 6 月 26 日的报道,GPT-5.6 对缓存输入保留 90% 的折扣,有明确的缓存断点,最短缓存有效期为 30 分钟。缓存写入按 1.25 倍计费,一次性成本很小。
系统提示词在每次调用中都一样,这正是应该缓存的部分。对于每次请求都发送 2000 token 指令块的功能而言,缓存能让这部分输入的成本降低 90%,而且是在你已经选择的档位基础之上叠加的。
we are
stennir 是一家 AI 咨询公司,负责搭建路由层,让你的功能识别每次调用,把便宜的工作发给 Luna,把真正需要推理的部分发给 Sol。
we aren't
stennir 不是那种把你的模型 ID 换成最便宜档位、然后寄希望于质量不受影响的经销商。
要拿到这个效果,需要重建整个功能吗?
不需要。我们的产品线 AI 方案本身就已经按任务拆分了流量:路由、打标签和内容审核走便宜档位,推理走旗舰档位。所以像 Luna 这样的新档位,只是在便宜通道上改一下配置,而不是重建用户依赖的这个功能。
如果你的功能现在把所有调用都发给同一个模型,这就是首先要补上的差距。拆分工作量大概一两天,而节省的成本会随着用量增长每个月不断累积。
我们的 CFO 没有问用的是哪个模型,他问的是一个活跃用户让我们花多少钱。档位拆分就是让这个功能顺利通过复盘的答案。
这属于我们咨询服务的范畴,日志里也有我们已经落地生产的功能的实际数据。如果你想在下一次财务复盘之前拿到自己的数字,预约一次 30 分钟摸底通话,我们会和你一起梳理你的功能流量拆分方案。