深度報告
-
GPT-5.6 Luna 是 OpenAI 於 2026 年 7 月 9 日正式釋出的 GPT-5.6 系列中的「輕量檔」模型,對應拉丁語中的「月亮」(Luna)。它與旗艦 Sol(太陽)、均衡 Terra(地球)同屬一個代際,但定位為家族中速度最快、成本最低的一檔。Luna 的 API 定價僅為每百萬輸入 token 1 美元、輸出 6 美元,約為上一代 GPT-5.5 的五分之一,官方稱其在大幅降低的單位成本下,效能可接近 GPT-5.5 的峰值水平。它不是用來取代旗艦做複雜推理的,而是為「量大、延遲敏感、結構穩定」的高頻任務而生:批次摘要、文字分類、意圖路由、FAQ 匹配、簡單抽取與常規自動化。
-
GPT-5.6 系列在經歷約兩週的有限預覽期、並與美國監管方就網路安全與生物風險能力完成溝通後,於北京時間 2026 年 7 月 10 日凌晨透過線上直播正式面向全球推出。Luna 作為三檔中最低成本的一檔同步上線,覆蓋 ChatGPT、Codex 與 OpenAI API,全球推送在 24 小時內完成。本次釋出還伴隨一系列生態動作:Codex App 正式併入 ChatGPT 桌面應用,OpenAI 推出對標 Claude Cowork、WorkBuddy 的桌面智慧體工具 ChatGPT Work,並引入 max / ultra 兩種新的推理強度設定。
-
Luna 與 Sol、Terra 共享相同的 105 萬 token 上下文視窗和 12.8 萬 token 最大輸出長度,知識截止於 2026 年 2 月。它接受文字、圖片與檔案作為輸入,輸出純文字,不支援原生音訊與影片,也不支援微調(fine-tuning)。在工具能力上,Luna 透過 Responses API 支援流式輸出、函式呼叫、結構化輸出、網頁搜尋、檔案搜尋、影象生成工具、程式碼直譯器、託管 shell、apply patch、skills、computer use、MCP 與工具搜尋。新增的 max 推理模式讓模型投入更多時間自檢與修正,ultra 模式則預設協調 4 個並行智慧體(最高可擴充套件至 16 個)處理複雜任務——儘管後者更多面向 Sol 這類旗艦場景。
-
Luna 的官方定價為每百萬 token 輸入 1 美元、輸出 6 美元,是 GPT-5.6 家族中最便宜的一檔,也是目前 OpenAI 面向高吞吐場景最具價效比的公開模型。在提示詞快取方面,GPT-5.6 引入了更可預測的快取機制:支援顯式快取斷點(cache breakpoint)與 30 分鐘最低快取生命週期;快取寫入按未快取輸入費率的 1.25 倍計費,快取讀取則享受 90% 的折扣。這意味著對 Luna 的典型負載——固定的系統提示、冗長的公司政策、知識庫片段、分類法——重複輸入成本可下降 90%,輸入價在快取命中時實際降至每百萬 token 0.10 美元。需要特別注意的是,不帶字尾的 API 別名 gpt-5.6 會路由到旗艦 Sol 而非 Luna,開發者應在程式碼中顯式指定 gpt-5.6-luna,避免悄無聲息地按最貴的費率付費。
-
在 Artificial Analysis 智慧指數上,Luna 得分 51.2(Sol 為 59),在 153 個已評測模型中排名第 10;GPQA Diamond 得分 91%,Humanity's Last Exam 約 37%,SciCode 53%,設計競技場 Elo 1263。速度方面,Luna 實測輸出約 160–204 token/秒,首 token 延遲(p50)約 1.4 秒,一個字的暖機回覆最快 658 毫秒返回,是第三方追蹤中第 7 快的模型。在長上下文檢索評測(512K–1M 多針檢索)上,Luna 得分僅 41.3,明顯低於 Sol 的 73.8 與 Terra 的 72.5——這說明它的長文件可靠性隨上下文拉長而急劇下降。在文件解析基準 ParseBench 上,Luna 比 Sol 便宜約 6 倍,在文字與表格上的精度損失僅屬輕微,但整個 GPT-5.6 家族在圖表與版式密集的頁面上仍偏弱。
-
Luna 的領地由三條標準定義:形態可預測、吞吐量大、答錯成本低。具體用例包括意圖分類、短文字抽取、FAQ 匹配、郵件分診、簡單摘要、批次自動化、客服機器人與高併發初稿撰寫。工程上更成熟的 AI 工作流應像交通系統一樣「分車道」:簡單、便宜、可預測的任務走 Luna;常規推理、業務處理、內部助手走 Terra;複雜智慧體、關鍵審查、高風險決策支援走 Sol。一個常見的生產模式是預設呼叫 Luna,只有當 schema 校驗、單元測試或置信度門控未透過時才逐級升級到 Terra 或 Sol——由於 Luna 支援推理 token,先調高它的 reasoning effort 往往比直接跳檔更省錢。
-
Luna 的核心優勢是極致的單位經濟性與速度:完整 105 萬 token 上下文、無上下文長度附加費、暖機回覆亞秒級、對「JSON only」等嚴格格式服從度高、批次分類與摘要首輪即可準確完成。它的主要侷限在於:在真正的多步硬推理上處於家族末位;不支援微調、無原生音訊、無法在消費版 ChatGPT App 中直接選擇、也未提交至獨立的 SWE-bench Verified 排行榜;長上下文檢索(512K–1M)能力斷崖式下滑,不適合需要跨數十萬 token 精準檢索的負載;圖表與版式解析是整代模型的共性弱項。綜合來看,Luna 是一個「按任務形狀路由」體系裡的高吞吐零件,而非旗艦的平替。
-
第三方實測普遍給出正面評價:ThePlanetTools 的 API 實測給 Luna 打出 8.6/10,稱其是「當體量與速度比最後那幾分原始智慧更重要時的首選檔」,並在策略文件摘要、釋出郵件草擬、工單批次分類與暖機回覆上表現乾淨利落。開發者社群將其概括為「為狹窄、可並行任務服務的快速廉價工人」。但也有共識性的提醒:基準資料多來自發布初期,應視為方向性參考並在自身負載上驗證;Luna 在中文寫作上「夠用」(中文訓練約佔其資料的 28%);把它用於所有請求會拉低複雜場景質量,把所有請求都走 Sol 則賬單本身會變成一份架構審查報告。多數意見認為,選錯模型往往是路由策略的問題,而非模型本身。
-
- OpenAI 官方公告:GPT-5.6 系列(https://openai.com/zh-Hans-CN/index/gpt-5-6/) - OpenAI 幫助中心:GPT-5.6 Sol、Terra 與 Luna 預覽(https://help.openai.com/zh-hans-cn/articles/20001325-a-preview-of-gpt-56-sol-terra-and-luna) - 新華社:OpenAI 推出 GPT-5.6 系列模型(https://www.163.com/dy/article/L1FPS77G05346RC6.html) - 中國日報:OpenAI 推出 GPT-5.6 系列模型(https://cn.chinadaily.com.cn/a/202607/10/WS6a509d35a310d709c2fbcddb.html) - 機器之心:GPT-5.6 全面上線,Codex 被合併,ChatGPT Work 來了(https://c.m.163.com/news/a/L1FKQ07B0511AQHO.html) - Artificial Analysis 智慧指數與速度排行(https://modelgrep.com/models/openai/gpt-5.6-luna) - ThePlanetTools 實測評測(https://theplanettools.ai/tools/gpt-5-6-luna) - Apifox GPT-5.6 定價詳解(https://apifox.com/apiskills/gpt-5-6-ding-jie-xiang-jie-sol-terra-he-luna-de-cheng-ben-ji-sheng-qian-gong-lue-2) - PoloAPI 三檔路由建議(https://poloapi.com/poloapi-blog.html?slug=How-to-choose-between-three-levels-of-GPT-5.6) - Neodrop GPT-5.6 公開版解讀(https://neodrop.ai/zh-cn/post/qcoqpKwFH2L)
使用者評論
-
AliceJackson—把公司的批次摘要管線切到了 Luna,跑了一整天沒出岔子,成本直接從之前的每月三千塊壓到不到一千,省下來的預算還能再多跑幾個方向。不過我們同時用 Sol 跑了一條同樣的資料做對比,發現 Luna 在摘要的資訊密度上確實有差距,關鍵細節偶爾丟失,但勝在量大管飽速度起飛。 -
hAROLD17—今天試了下 Luna 做分類任務,確實快,響應基本在一秒內。但一丟複雜邏輯它就露怯了,拿不準的還是得上 Terra。 -
DennisPhillips_88—之前用 Opus 4.8 跑的資訊抽取現在全換 Luna 了,質量沒降多少,價格降到四分之一不到,這價效比確實離譜。唯一的問題是 Luna 在抽取巢狀 JSON 結構時偶爾會丟欄位,後來我在 prompt 里加了詳細的 schema 示例和必填欄位檢查,之後基本沒出過問題。 -
JJimenez_66—Luna 的上下文視窗竟然也有一百萬 token,用 Prompt Caching 之後,長篇文件處理幾乎不要錢。 -
EVsmi—Luna 做客服對話的意圖識別,響應時間平均 600 多毫秒,比之前用的模型快了一倍。量大的時候體驗差距特別明顯。 -
47wi8—一開始以為 Luna 只是個縮水版,實測下來其實該有的工具箱全都有,tool calling、structured output、reasoning effort 一個不落,就是推理深度有限。 -
CPatel_2024—最香的是 Luna 帶完整智慧體工具棧,能在低預算下跑 RAG 管線,我們整個知識庫的問答對就是 Luna 批次生成的。 -
MoonMoonMiller—簡單問答和文案生成 Luna 完全夠用,但讓它做個競品分析就明顯不如 Terra 了,生成的結構淺,維度不全。 -
騎士915—Luna 在 Terminal-Bench 2.1 上竟然比 Terra 還高,這讓我挺意外的。不是 Luna 強,是 Terra 在這項上表現一般。 -
月光_25—寫了個路由層,簡單任務走 Luna,中等難度走 Terra,硬骨頭交給 Sol,一個月下來 token 開銷降了 60%。三檔分層的價值在這時候最明顯。Luna 大概處理了 70% 的請求量,但開銷只佔總賬單的 20%,這個比例足以說服老闆給我撥預算做更多 AI 實驗了。 -
Megan_Torres_7—Luna 速度是真的快,大概 Sol 的三倍,但用的時候心裡得有數——它只是最便宜的那個選擇,不是萬能的。 -
NodeKpng—我們的批次文字分類全切 Luna 了,準確率跟之前用 GPT-5.5 時差不多,但賬單直接從 3000 刀掉到 600 刀,老闆很開心。不過有個坑——Luna 在多標籤分類任務上不如單標籤穩定,後面給 prompt 加了排序約束條件,準確率才回到之前水平。 -
Adam.King_66—Luna 的 long-context 不能迷信。有個評測說它長上下文只有 41.3%,我之前用它讀一篇 8 萬 token 的文件,中間確實丟了不少細節。 -
MargaretKim_2020—做內容稽核管線 Luna 簡直神器,又便宜又快,準確率還能接受。超出置信區間的再路由給人工,整體效率提升巨大。 -
DhruvPatil—說實話這個定價策略挺聰明的,Luna 負責跑量、Terra 負責日常、Sol 負責最難的任務,按難度路由之後總成本直接打下來一多半。我算了一下,我們團隊之前全部用 GPT-5.5 一個月大概 8000 刀,切到三檔路由後壓縮到不到 3000 刀,而且實測 Luna 在小任務上的表現和 5.5 沒本質區別。 -
蕭晨飛—Luna 雖然價格低,但 fine-tuning 目前不支援,這對想定製模型的企業來說是個硬傷,希望後續能加上。 -
JHernandez_2024566—其實 Luna 最超值的用法是做 prompt caching 的測試環境,系統提示詞隨便改、隨便試,跑一萬輪也就幾塊錢,除錯成本直接歸零。 -
CarolynPowellZ—試了一圈 Luna 做程式碼審查,簡單的程式碼風格問題和明顯的 bug 能抓到,但涉及設計模式或者效能最佳化的建議就沒啥見地了。 -
BillyWhiteIII—Luna 最大的槽點是消費者版 ChatGPT 裡選不了,只能 API 或者 ChatGPT Work 才能用,對個人使用者太不友好了。 -
Zachary.CampbellX—今天把 Luna 接入了自動客服,日呼叫量十幾萬次,響應基本沒延遲。偶爾會有答非所問的情況,但加一層校驗後基本能兜住。不過有個問題就是 Luna 不太能處理多輪對話中的上下文漂移,三四輪之後容易跑偏,我們在前面加了個 context summarizer 做壓縮後才穩定下來。 -
曾建—小團隊福音,之前用 GPT-5.5 每月 API 賬單大幾千,現在大部分流量走 Luna,賬單降到兩千以內,而且核心功能沒減配。 -
Dkmit—Luna 做郵件模板生成的效率太高了,幾千封營銷郵件的內容變體,十分鐘跑完,成本才幾毛錢。放以前得專門安排實習生幹一整天。 -
AdamBaileyIII—輸出 $6/1M tokens,用 batch 還能再打五折。我們算了一筆賬,一個典型的摘要任務在 Luna 上大概 0.0002 美分一次,可以忽略不計了。 -
Jonathan_Simmons0071—不支援原生音訊有點可惜,但純文字高吞吐場景它也用不上音訊。 -
BlockReward736—一句話:簡單便宜可預測走 Luna,常規業務走 Terra,複雜智慧體走 Sol,別讓一個模型幹所有活。 -
KeithCooper37—專案初期原型驗證全部用 Luna,快又省,等產品方向確定了再決定要不要切到更貴的模型。這種漸進式策略在創業團隊裡應該很普遍。 -
BullRunMeyer—我們把「先 Luna 不行再升級 Terra/Sol」寫進了重試邏輯,出問題自動跳檔,體驗很絲滑。 -
ticklishmeercat996—雖然 Luna 是系列裡最便宜的檔位,但它超越 Opus 4.8 這件事本身就說明現在輕量模型的底線已經被拉得很高了。 -
Debra525—首 token 1.4 秒、暖機 658 毫秒,這速度做實時互動完全夠。 -
PMorgan_66—Luna 在 ExploitGym 上的表現說明它做基礎安全過濾是夠用的,隨著推理強度提升還有空間,但對重量級安全掃描還是得 Sol。