GPT-5.6 Luna

OpenAI GPT-5.6 系列中速度最快、成本最低的轻量档模型,专为高吞吐、低延迟的批量任务而生

In-depth Report

  • GPT-5.6 Luna 是 OpenAI 于 2026 年 7 月 9 日正式发布的 GPT-5.6 系列中的「轻量档」模型,对应拉丁语中的「月亮」(Luna)。它与旗舰 Sol(太阳)、均衡 Terra(地球)同属一个代际,但定位为家族中速度最快、成本最低的一档。Luna 的 API 定价仅为每百万输入 token 1 美元、输出 6 美元,约为上一代 GPT-5.5 的五分之一,官方称其在大幅降低的单位成本下,性能可接近 GPT-5.5 的峰值水平。它不是用来取代旗舰做复杂推理的,而是为「量大、延迟敏感、结构稳定」的高频任务而生:批量摘要、文本分类、意图路由、FAQ 匹配、简单抽取与常规自动化。

  • GPT-5.6 系列在经历约两周的有限预览期、并与美国监管方就网络安全与生物风险能力完成沟通后,于北京时间 2026 年 7 月 10 日凌晨通过线上直播正式面向全球推出。Luna 作为三档中最低成本的一档同步上线,覆盖 ChatGPT、Codex 与 OpenAI API,全球推送在 24 小时内完成。本次发布还伴随一系列生态动作:Codex App 正式并入 ChatGPT 桌面应用,OpenAI 推出对标 Claude Cowork、WorkBuddy 的桌面智能体工具 ChatGPT Work,并引入 max / ultra 两种新的推理强度设置。

  • Luna 与 Sol、Terra 共享相同的 105 万 token 上下文窗口和 12.8 万 token 最大输出长度,知识截止于 2026 年 2 月。它接受文本、图片与文件作为输入,输出纯文本,不支持原生音频与视频,也不支持微调(fine-tuning)。在工具能力上,Luna 通过 Responses API 支持流式输出、函数调用、结构化输出、网页搜索、文件搜索、图像生成工具、代码解释器、托管 shell、apply patch、skills、computer use、MCP 与工具搜索。新增的 max 推理模式让模型投入更多时间自检与修正,ultra 模式则默认协调 4 个并行智能体(最高可扩展至 16 个)处理复杂任务——尽管后者更多面向 Sol 这类旗舰场景。

  • Luna 的官方定价为每百万 token 输入 1 美元、输出 6 美元,是 GPT-5.6 家族中最便宜的一档,也是目前 OpenAI 面向高吞吐场景最具性价比的公开模型。在提示词缓存方面,GPT-5.6 引入了更可预测的缓存机制:支持显式缓存断点(cache breakpoint)与 30 分钟最低缓存生命周期;缓存写入按未缓存输入费率的 1.25 倍计费,缓存读取则享受 90% 的折扣。这意味着对 Luna 的典型负载——固定的系统提示、冗长的公司政策、知识库片段、分类法——重复输入成本可下降 90%,输入价在缓存命中时实际降至每百万 token 0.10 美元。需要特别注意的是,不带后缀的 API 别名 gpt-5.6 会路由到旗舰 Sol 而非 Luna,开发者应在代码中显式指定 gpt-5.6-luna,避免悄无声息地按最贵的费率付费。

  • 在 Artificial Analysis 智能指数上,Luna 得分 51.2(Sol 为 59),在 153 个已评测模型中排名第 10;GPQA Diamond 得分 91%,Humanity's Last Exam 约 37%,SciCode 53%,设计竞技场 Elo 1263。速度方面,Luna 实测输出约 160–204 token/秒,首 token 延迟(p50)约 1.4 秒,一个字的暖机回复最快 658 毫秒返回,是第三方追踪中第 7 快的模型。在长上下文检索评测(512K–1M 多针检索)上,Luna 得分仅 41.3,明显低于 Sol 的 73.8 与 Terra 的 72.5——这说明它的长文档可靠性随上下文拉长而急剧下降。在文档解析基准 ParseBench 上,Luna 比 Sol 便宜约 6 倍,在文本与表格上的精度损失仅属轻微,但整个 GPT-5.6 家族在图表与版式密集的页面上仍偏弱。

  • Luna 的领地由三条标准定义:形态可预测、吞吐量大、答错成本低。具体用例包括意图分类、短文本抽取、FAQ 匹配、邮件分诊、简单摘要、批量自动化、客服机器人与高并发初稿撰写。工程上更成熟的 AI 工作流应像交通系统一样「分车道」:简单、便宜、可预测的任务走 Luna;常规推理、业务处理、内部助手走 Terra;复杂智能体、关键审查、高风险决策支持走 Sol。一个常见的生产模式是默认调用 Luna,只有当 schema 校验、单元测试或置信度门控未通过时才逐级升级到 Terra 或 Sol——由于 Luna 支持推理 token,先调高它的 reasoning effort 往往比直接跳档更省钱。

  • Luna 的核心优势是极致的单位经济性与速度:完整 105 万 token 上下文、无上下文长度附加费、暖机回复亚秒级、对「JSON only」等严格格式服从度高、批量分类与摘要首轮即可准确完成。它的主要局限在于:在真正的多步硬推理上处于家族末位;不支持微调、无原生音频、无法在消费版 ChatGPT App 中直接选择、也未提交至独立的 SWE-bench Verified 排行榜;长上下文检索(512K–1M)能力断崖式下滑,不适合需要跨数十万 token 精准检索的负载;图表与版式解析是整代模型的共性弱项。综合来看,Luna 是一个「按任务形状路由」体系里的高吞吐零件,而非旗舰的平替。

  • 第三方实测普遍给出正面评价:ThePlanetTools 的 API 实测给 Luna 打出 8.6/10,称其是「当体量与速度比最后那几分原始智能更重要时的首选档」,并在策略文档摘要、发布邮件草拟、工单批量分类与暖机回复上表现干净利落。开发者社区将其概括为「为狭窄、可并行任务服务的快速廉价工人」。但也有共识性的提醒:基准数据多来自发布初期,应视为方向性参考并在自身负载上验证;Luna 在中文写作上「够用」(中文训练约占其数据的 28%);把它用于所有请求会拉低复杂场景质量,把所有请求都走 Sol 则账单本身会变成一份架构审查报告。多数意见认为,选错模型往往是路由策略的问题,而非模型本身。

  • - OpenAI 官方公告:GPT-5.6 系列(https://openai.com/zh-Hans-CN/index/gpt-5-6/) - OpenAI 帮助中心:GPT-5.6 Sol、Terra 与 Luna 预览(https://help.openai.com/zh-hans-cn/articles/20001325-a-preview-of-gpt-56-sol-terra-and-luna) - 新华社:OpenAI 推出 GPT-5.6 系列模型(https://www.163.com/dy/article/L1FPS77G05346RC6.html) - 中国日报:OpenAI 推出 GPT-5.6 系列模型(https://cn.chinadaily.com.cn/a/202607/10/WS6a509d35a310d709c2fbcddb.html) - 机器之心:GPT-5.6 全面上线,Codex 被合并,ChatGPT Work 来了(https://c.m.163.com/news/a/L1FKQ07B0511AQHO.html) - Artificial Analysis 智能指数与速度排行(https://modelgrep.com/models/openai/gpt-5.6-luna) - ThePlanetTools 实测评测(https://theplanettools.ai/tools/gpt-5-6-luna) - Apifox GPT-5.6 定价详解(https://apifox.com/apiskills/gpt-5-6-ding-jie-xiang-jie-sol-terra-he-luna-de-cheng-ben-ji-sheng-qian-gong-lue-2) - PoloAPI 三档路由建议(https://poloapi.com/poloapi-blog.html?slug=How-to-choose-between-three-levels-of-GPT-5.6) - Neodrop GPT-5.6 公开版解读(https://neodrop.ai/zh-cn/post/qcoqpKwFH2L)

User Reviews

  • 头像
    AliceJackson
    把公司的批量摘要管线切到了 Luna,跑了一整天没出岔子,成本直接从之前的每月三千块压到不到一千,省下来的预算还能再多跑几个方向。不过我们同时用 Sol 跑了一条同样的数据做对比,发现 Luna 在摘要的信息密度上确实有差距,关键细节偶尔丢失,但胜在量大管饱速度起飞。

  • 头像
    hAROLD17
    今天试了下 Luna 做分类任务,确实快,响应基本在一秒内。但一丢复杂逻辑它就露怯了,拿不准的还是得上 Terra。

  • 头像
    DennisPhillips_88
    之前用 Opus 4.8 跑的信息抽取现在全换 Luna 了,质量没降多少,价格降到四分之一不到,这性价比确实离谱。唯一的问题是 Luna 在抽取嵌套 JSON 结构时偶尔会丢字段,后来我在 prompt 里加了详细的 schema 示例和必填字段检查,之后基本没出过问题。

  • 头像
    JJimenez_66
    Luna 的上下文窗口竟然也有一百万 token,用 Prompt Caching 之后,长篇文档处理几乎不要钱。

  • 头像
    EVsmi
    Luna 做客服对话的意图识别,响应时间平均 600 多毫秒,比之前用的模型快了一倍。量大的时候体验差距特别明显。

  • 头像
    47wi8
    一开始以为 Luna 只是个缩水版,实测下来其实该有的工具箱全都有,tool calling、structured output、reasoning effort 一个不落,就是推理深度有限。

  • 头像
    CPatel_2024
    最香的是 Luna 带完整智能体工具栈,能在低预算下跑 RAG 管线,我们整个知识库的问答对就是 Luna 批量生成的。

  • 头像
    MoonMoonMiller
    简单问答和文案生成 Luna 完全够用,但让它做个竞品分析就明显不如 Terra 了,生成的结构浅,维度不全。

  • 头像
    骑士915
    Luna 在 Terminal-Bench 2.1 上竟然比 Terra 还高,这让我挺意外的。不是 Luna 强,是 Terra 在这项上表现一般。

  • 头像
    月光_25
    写了个路由层,简单任务走 Luna,中等难度走 Terra,硬骨头交给 Sol,一个月下来 token 开销降了 60%。三档分层的价值在这时候最明显。Luna 大概处理了 70% 的请求量,但开销只占总账单的 20%,这个比例足以说服老板给我拨预算做更多 AI 实验了。

  • 头像
    Megan_Torres_7
    Luna 速度是真的快,大概 Sol 的三倍,但用的时候心里得有数——它只是最便宜的那个选择,不是万能的。

  • 头像
    NodeKpng
    我们的批量文本分类全切 Luna 了,准确率跟之前用 GPT-5.5 时差不多,但账单直接从 3000 刀掉到 600 刀,老板很开心。不过有个坑——Luna 在多标签分类任务上不如单标签稳定,后面给 prompt 加了排序约束条件,准确率才回到之前水平。

  • 头像
    Adam.King_66
    Luna 的 long-context 不能迷信。有个评测说它长上下文只有 41.3%,我之前用它读一篇 8 万 token 的文档,中间确实丢了不少细节。

  • 头像
    MargaretKim_2020
    做内容审核管线 Luna 简直神器,又便宜又快,准确率还能接受。超出置信区间的再路由给人工,整体效率提升巨大。

  • 头像
    DhruvPatil
    说实话这个定价策略挺聪明的,Luna 负责跑量、Terra 负责日常、Sol 负责最难的任务,按难度路由之后总成本直接打下来一多半。我算了一下,我们团队之前全部用 GPT-5.5 一个月大概 8000 刀,切到三档路由后压缩到不到 3000 刀,而且实测 Luna 在小任务上的表现和 5.5 没本质区别。

  • 头像
    萧晨飞
    Luna 虽然价格低,但 fine-tuning 目前不支持,这对想定制模型的企业来说是个硬伤,希望后续能加上。

  • 头像
    JHernandez_2024566
    其实 Luna 最超值的用法是做 prompt caching 的测试环境,系统提示词随便改、随便试,跑一万轮也就几块钱,调试成本直接归零。

  • 头像
    CarolynPowellZ
    试了一圈 Luna 做代码审查,简单的代码风格问题和明显的 bug 能抓到,但涉及设计模式或者性能优化的建议就没啥见地了。

  • 头像
    BillyWhiteIII
    Luna 最大的槽点是消费者版 ChatGPT 里选不了,只能 API 或者 ChatGPT Work 才能用,对个人用户太不友好了。

  • 头像
    Zachary.CampbellX
    今天把 Luna 接入了自动客服,日调用量十几万次,响应基本没延迟。偶尔会有答非所问的情况,但加一层校验后基本能兜住。不过有个问题就是 Luna 不太能处理多轮对话中的上下文漂移,三四轮之后容易跑偏,我们在前面加了个 context summarizer 做压缩后才稳定下来。

  • 头像
    曾建
    小团队福音,之前用 GPT-5.5 每月 API 账单大几千,现在大部分流量走 Luna,账单降到两千以内,而且核心功能没减配。

  • 头像
    Dkmit
    Luna 做邮件模板生成的效率太高了,几千封营销邮件的内容变体,十分钟跑完,成本才几毛钱。放以前得专门安排实习生干一整天。

  • 头像
    AdamBaileyIII
    输出 $6/1M tokens,用 batch 还能再打五折。我们算了一笔账,一个典型的摘要任务在 Luna 上大概 0.0002 美分一次,可以忽略不计了。

  • 头像
    Jonathan_Simmons0071
    不支持原生音频有点可惜,但纯文本高吞吐场景它也用不上音频。

  • 头像
    BlockReward736
    一句话:简单便宜可预测走 Luna,常规业务走 Terra,复杂智能体走 Sol,别让一个模型干所有活。

  • 头像
    KeithCooper37
    项目初期原型验证全部用 Luna,快又省,等产品方向确定了再决定要不要切到更贵的模型。这种渐进式策略在创业团队里应该很普遍。

  • 头像
    BullRunMeyer
    我们把「先 Luna 不行再升级 Terra/Sol」写进了重试逻辑,出问题自动跳档,体验很丝滑。

  • 头像
    ticklishmeercat996
    虽然 Luna 是系列里最便宜的档位,但它超越 Opus 4.8 这件事本身就说明现在轻量模型的底线已经被拉得很高了。

  • 头像
    Debra525
    首 token 1.4 秒、暖机 658 毫秒,这速度做实时交互完全够。

  • 头像
    PMorgan_66
    Luna 在 ExploitGym 上的表现说明它做基础安全过滤是够用的,随着推理强度提升还有空间,但对重量级安全扫描还是得 Sol。