深度报告
-
GPT-5.6 Luna 是 OpenAI 于 2026 年 7 月 9 日正式发布的 GPT-5.6 系列中的「轻量档」模型,对应拉丁语中的「月亮」(Luna)。它与旗舰 Sol(太阳)、均衡 Terra(地球)同属一个代际,但定位为家族中速度最快、成本最低的一档。Luna 的 API 定价仅为每百万输入 token 1 美元、输出 6 美元,约为上一代 GPT-5.5 的五分之一,官方称其在大幅降低的单位成本下,性能可接近 GPT-5.5 的峰值水平。它不是用来取代旗舰做复杂推理的,而是为「量大、延迟敏感、结构稳定」的高频任务而生:批量摘要、文本分类、意图路由、FAQ 匹配、简单抽取与常规自动化。
-
GPT-5.6 系列在经历约两周的有限预览期、并与美国监管方就网络安全与生物风险能力完成沟通后,于北京时间 2026 年 7 月 10 日凌晨通过线上直播正式面向全球推出。Luna 作为三档中最低成本的一档同步上线,覆盖 ChatGPT、Codex 与 OpenAI API,全球推送在 24 小时内完成。本次发布还伴随一系列生态动作:Codex App 正式并入 ChatGPT 桌面应用,OpenAI 推出对标 Claude Cowork、WorkBuddy 的桌面智能体工具 ChatGPT Work,并引入 max / ultra 两种新的推理强度设置。
-
Luna 与 Sol、Terra 共享相同的 105 万 token 上下文窗口和 12.8 万 token 最大输出长度,知识截止于 2026 年 2 月。它接受文本、图片与文件作为输入,输出纯文本,不支持原生音频与视频,也不支持微调(fine-tuning)。在工具能力上,Luna 通过 Responses API 支持流式输出、函数调用、结构化输出、网页搜索、文件搜索、图像生成工具、代码解释器、托管 shell、apply patch、skills、computer use、MCP 与工具搜索。新增的 max 推理模式让模型投入更多时间自检与修正,ultra 模式则默认协调 4 个并行智能体(最高可扩展至 16 个)处理复杂任务——尽管后者更多面向 Sol 这类旗舰场景。
-
Luna 的官方定价为每百万 token 输入 1 美元、输出 6 美元,是 GPT-5.6 家族中最便宜的一档,也是目前 OpenAI 面向高吞吐场景最具性价比的公开模型。在提示词缓存方面,GPT-5.6 引入了更可预测的缓存机制:支持显式缓存断点(cache breakpoint)与 30 分钟最低缓存生命周期;缓存写入按未缓存输入费率的 1.25 倍计费,缓存读取则享受 90% 的折扣。这意味着对 Luna 的典型负载——固定的系统提示、冗长的公司政策、知识库片段、分类法——重复输入成本可下降 90%,输入价在缓存命中时实际降至每百万 token 0.10 美元。需要特别注意的是,不带后缀的 API 别名 gpt-5.6 会路由到旗舰 Sol 而非 Luna,开发者应在代码中显式指定 gpt-5.6-luna,避免悄无声息地按最贵的费率付费。
-
在 Artificial Analysis 智能指数上,Luna 得分 51.2(Sol 为 59),在 153 个已评测模型中排名第 10;GPQA Diamond 得分 91%,Humanity's Last Exam 约 37%,SciCode 53%,设计竞技场 Elo 1263。速度方面,Luna 实测输出约 160–204 token/秒,首 token 延迟(p50)约 1.4 秒,一个字的暖机回复最快 658 毫秒返回,是第三方追踪中第 7 快的模型。在长上下文检索评测(512K–1M 多针检索)上,Luna 得分仅 41.3,明显低于 Sol 的 73.8 与 Terra 的 72.5——这说明它的长文档可靠性随上下文拉长而急剧下降。在文档解析基准 ParseBench 上,Luna 比 Sol 便宜约 6 倍,在文本与表格上的精度损失仅属轻微,但整个 GPT-5.6 家族在图表与版式密集的页面上仍偏弱。
-
Luna 的领地由三条标准定义:形态可预测、吞吐量大、答错成本低。具体用例包括意图分类、短文本抽取、FAQ 匹配、邮件分诊、简单摘要、批量自动化、客服机器人与高并发初稿撰写。工程上更成熟的 AI 工作流应像交通系统一样「分车道」:简单、便宜、可预测的任务走 Luna;常规推理、业务处理、内部助手走 Terra;复杂智能体、关键审查、高风险决策支持走 Sol。一个常见的生产模式是默认调用 Luna,只有当 schema 校验、单元测试或置信度门控未通过时才逐级升级到 Terra 或 Sol——由于 Luna 支持推理 token,先调高它的 reasoning effort 往往比直接跳档更省钱。
-
Luna 的核心优势是极致的单位经济性与速度:完整 105 万 token 上下文、无上下文长度附加费、暖机回复亚秒级、对「JSON only」等严格格式服从度高、批量分类与摘要首轮即可准确完成。它的主要局限在于:在真正的多步硬推理上处于家族末位;不支持微调、无原生音频、无法在消费版 ChatGPT App 中直接选择、也未提交至独立的 SWE-bench Verified 排行榜;长上下文检索(512K–1M)能力断崖式下滑,不适合需要跨数十万 token 精准检索的负载;图表与版式解析是整代模型的共性弱项。综合来看,Luna 是一个「按任务形状路由」体系里的高吞吐零件,而非旗舰的平替。
-
第三方实测普遍给出正面评价:ThePlanetTools 的 API 实测给 Luna 打出 8.6/10,称其是「当体量与速度比最后那几分原始智能更重要时的首选档」,并在策略文档摘要、发布邮件草拟、工单批量分类与暖机回复上表现干净利落。开发者社区将其概括为「为狭窄、可并行任务服务的快速廉价工人」。但也有共识性的提醒:基准数据多来自发布初期,应视为方向性参考并在自身负载上验证;Luna 在中文写作上「够用」(中文训练约占其数据的 28%);把它用于所有请求会拉低复杂场景质量,把所有请求都走 Sol 则账单本身会变成一份架构审查报告。多数意见认为,选错模型往往是路由策略的问题,而非模型本身。
-
- OpenAI 官方公告:GPT-5.6 系列(https://openai.com/zh-Hans-CN/index/gpt-5-6/) - OpenAI 帮助中心:GPT-5.6 Sol、Terra 与 Luna 预览(https://help.openai.com/zh-hans-cn/articles/20001325-a-preview-of-gpt-56-sol-terra-and-luna) - 新华社:OpenAI 推出 GPT-5.6 系列模型(https://www.163.com/dy/article/L1FPS77G05346RC6.html) - 中国日报:OpenAI 推出 GPT-5.6 系列模型(https://cn.chinadaily.com.cn/a/202607/10/WS6a509d35a310d709c2fbcddb.html) - 机器之心:GPT-5.6 全面上线,Codex 被合并,ChatGPT Work 来了(https://c.m.163.com/news/a/L1FKQ07B0511AQHO.html) - Artificial Analysis 智能指数与速度排行(https://modelgrep.com/models/openai/gpt-5.6-luna) - ThePlanetTools 实测评测(https://theplanettools.ai/tools/gpt-5-6-luna) - Apifox GPT-5.6 定价详解(https://apifox.com/apiskills/gpt-5-6-ding-jie-xiang-jie-sol-terra-he-luna-de-cheng-ben-ji-sheng-qian-gong-lue-2) - PoloAPI 三档路由建议(https://poloapi.com/poloapi-blog.html?slug=How-to-choose-between-three-levels-of-GPT-5.6) - Neodrop GPT-5.6 公开版解读(https://neodrop.ai/zh-cn/post/qcoqpKwFH2L)
用户评论
-
Jonathan_Simmons0071—不支持原生音频有点可惜,但纯文本高吞吐场景它也用不上音频。 -
BlockReward736—一句话:简单便宜可预测走 Luna,常规业务走 Terra,复杂智能体走 Sol,别让一个模型干所有活。 -
BullRunMeyer—我们把「先 Luna 不行再升级 Terra/Sol」写进了重试逻辑,出问题自动跳档,体验很丝滑。 -
Debra525—首 token 1.4 秒、暖机 658 毫秒,这速度做实时交互完全够。 -
清风426_1—中文场景下 Luna 够用了,据说中文训练数据占它大概 28%。我们用来做表单填写辅助和通用短文写作,质量稳定,格式服从度很高,让它只输出 JSON 基本不出错。当然复杂的中文长文润色还是上 Terra 更稳,但日常那些模板化、重复性的中文处理,Luna 完全顶得住,性价比拉满。 -
MasonBauer—Luna 在 ParseBench 上比 Sol 便宜 6 倍、精度只掉一丢丢,文本抽取直接无脑上。 -
Maria338—消费版 ChatGPT 里选不了 Luna,要玩还是得走 API,不过 Free/Go 默认就是 Terra,也还行。 -
angrycat146—想泼点冷水:现在网上那些 Luna 基准数据基本都来自发布头几天,样本少且多为厂商或单跑来源,只能当方向性参考。我们自己在生产负载上验证后发现,文本和表格抽取它确实接近 Sol 的水平、还便宜六倍,但一旦遇到图表和复杂版式,整代模型都不太行,该人工复核的地方千万别省。别盲目信榜单,跑自己的 eval 才靠谱。 -
xDariyaSkaskiv_2024—没有微调是个小遗憾,但我们这种走提示词路由的团队影响不大。 -
BlakeTurner—提醒一句:gpt-5.6 这个裸别名默认路由到 Sol,我上线第一天默默按 $5/$30 烧了一上午,记得显式写 gpt-5.6-luna。 -
HCampbell_758—很多人没注意到 Luna 配上新缓存机制有多香。我们的系统提示词加知识库片段固定好几万字,开启显式缓存断点之后,重复输入成本直接打一折,缓存命中时输入价实际只有 $0.10/M。对 Luna 这种天然高吞吐的负载来说,这几乎把成本结构重塑了一遍。强烈建议所有跑批量的团队都去配一下 cache breakpoint。 -
KellyThompson1688—真正用好 Luna 不是把它当旗舰平替,而是做分层路由。我们现在的架构是:意图分类、FAQ 匹配、邮件分诊这些低风险高重复的走 Luna;业务助手和常规代码补全走 Terra;只有涉及复杂多步智能体和关键决策时才上 Sol。这样整体账单比全用 Sol 省了差不多七成,用户体验却没有明显下降。OpenAI 这次三档分层比单一旗舰实用多了。 -
TylerHicks168—我们公司每天有十几万条客服消息要分类和意图识别,之前用 GPT-5.5 成本压不下来。换成 Luna 之后单条成本直接降到原来的五分之一左右,而且延迟低到几乎感知不到,批量跑一晚上就把历史工单全部重新打标完了。唯一要注意的是长上下文检索它确实弱,超过几十万字那种多文档问答还是得交给 Terra。 -
CRgon—实测暖机回复 600 多毫秒就回来了,高频小任务用 Sol 纯属浪费钱,Luna 才是批量场景的甜点。 -
PaigeClark—Luna 这价格真的香,$1/$6 跑分类和摘要简直是降维打击,我们工单路由全换上去了。