GPT-5.6 Luna
OpenAI GPT-5.6 シリーズの最速かつ低コストの軽量モデルで、高スループット、低遅延のバッチ タスク向けに設計されています。
詳細レポート
-
GPT-5.6 Lunaは、OpenAIが2026年7月9日に正式リリースしたGPT-5.6シリーズの「軽量」モデルで、ラテン語の「Luna」に相当します。フラッグシップのソル(太陽)やバランス型のテラ(地球)と同世代ですが、ファミリー内で最速かつ低コストという位置づけです。 Luna の API 価格は、入力トークン 100 万件あたりわずか 1 米ドル、出力トークン 100 万件あたり 6 米ドルで、前世代の GPT-5.5 の約 5 分の 1 です。関係者らは、大幅に削減された単価で性能を GPT-5.5 のピークレベルに近づけることができると主張しています。複雑な推論のための主力製品を置き換えるために使用されるのではなく、バッチ要約、テキスト分類、インテント ルーティング、FAQ マッチング、単純な抽出、一般的な自動化など、「大量、遅延感度、安定した構造」を備えた高頻度タスク向けに設計されています。
-
約 2 週間の限られたプレビュー期間と、サイバーセキュリティとバイオリスク機能に関する米国の規制当局とのコミュニケーションの完了後、GPT-5.6 シリーズは、北京時間 2026 年 7 月 10 日の早朝にオンライン ライブ ブロードキャストを通じて正式に全世界で発売されました。 Luna は、3 つのティアの中で最も低コストのティアとして、ChatGPT、Codex、OpenAI API をカバーすると同時に開始され、グローバル プッシュは 24 時間以内に完了しました。このリリースには、一連のエコロジー活動も伴います。Codex App は ChatGPT デスクトップ アプリケーションに正式に統合され、OpenAI は、Claude Cowork と WorkBuddy のベンチマークを行うデスクトップ エージェント ツールである ChatGPT Work を起動し、最大 / ウルトラの 2 つの新しい推論強度設定を導入します。
-
Luna は、Sol および Terra と同じ 105 万トークンのコンテキスト ウィンドウと 128,000 トークンの最大出力長を共有し、ナレッジは 2026 年 2 月に終了します。テキスト、画像、ファイルを入力として受け入れ、プレーン テキストを出力します。ネイティブのオーディオとビデオはサポートされておらず、微調整もサポートされていません。ツール機能の点では、Luna はストリーミング出力、関数呼び出し、構造化出力、Web 検索、ファイル検索、イメージ生成ツール、コード インタープリター、マネージド シェル、パッチの適用、スキル、コンピューターの使用、MCP、および Responses API を介したツール検索をサポートしています。新しい最大推論モードにより、モデルは自己テストと修正により多くの時間を投資できるようになり、ウルトラ モードはデフォルトで 4 つの並列エージェント (16 まで拡張可能) を調整して複雑なタスクを処理します。ただし、後者は Sol などの主力シナリオをより指向しています。
-
Luna の公式価格は、入力の場合は 100 万トークンあたり 1 米ドル、出力の場合は 6 米ドルです。 GPT-5.6 ファミリの中で最も安価で、現在、高スループット シナリオ向けの OpenAI の最もコスト効率の高いパブリック モデルです。プロンプト ワード キャッシュに関して、GPT-5.6 では、より予測可能なキャッシュ メカニズムが導入されています。明示的なキャッシュ ブレークポイントと 30 分の最小キャッシュ ライフ サイクルがサポートされています。キャッシュされた書き込みには、キャッシュされていない入力レートの 1.25 倍の料金が請求され、キャッシュされた読み取りには 90% の割引が適用されます。これは、Luna の一般的な負荷 (固定システム プロンプト、長い企業ポリシー、ナレッジ ベース スニペット、分類法) の場合、繰り返しのエントリ コストが 90% 削減され、キャッシュ ヒット時のエントリ価格は実質的に 100 万トークンあたり 0.10 ドルに下がる可能性があることを意味します。サフィックスのない API エイリアス gpt-5.6 は、Luna ではなく主力の Sol にルーティングされることに注意することが重要です。開発者は、最も高額な料金を黙って支払うことを避けるために、コード内で明示的に gpt-5.6-luna を指定する必要があります。
-
人工分析インテリジェンス指数では、Luna は 51.2 (59 Sol) を獲得し、レビューされた 153 モデル中 10 位にランクされました。 GPQA Diamond のスコアは 91%、人類最後の試験 ~37%、SciCode 53%、Design Arena Elo 1263 でした。速度の点では、Luna の測定出力は約 160 ~ 204 トークン/秒、最初のトークン遅延 (p50) は約 1.4 秒、1 ワードのウォームアップ応答は最速の 658 ミリ秒で返されます。サードパーティの追跡では 7 番目に速いモデルです。長いコンテキストの検索評価 (512K ~ 1M のマルチニードル検索) では、Luna のスコアはわずか 41.3 で、Sol の 73.8 や Terra の 72.5 よりも大幅に低かった。これは、コンテキストが長くなると、長いドキュメントの信頼性が急激に低下することを示しています。文書解析ベンチマーク ParseBench では、Luna は Sol より約 6 倍安く、テキストや表の精度の低下はわずかですが、GPT-5.6 ファミリ全体は、密集したグラフやレイアウトを含むページでは依然として弱いです。
-
ルナのテリトリーは、予測可能な形状、高スループット、誤答の低コストという 3 つの基準によって定義されます。 Specific use cases include intent classification, short text extraction, FAQ matching, email triage, simple summarization, batch automation, customer service robots and high-concurrency first draft writing. More mature AI workflows in engineering should be "divided into lanes" like a transportation system: simple, cheap, and predictable tasks go to Luna;一般的な推論、ビジネス処理、および内部アシスタントは Terra に送られます。複雑なエージェント、批判的なレビュー、リスクの高い意思決定のサポートは Sol に送られます。 A common production pattern is to call Luna by default, and only upgrade to Terra or Sol step by step when schema verification, unit testing, or confidence gating fails. Luna は推論トークンをサポートしているため、多くの場合、直接ジャンプするよりも最初に推論の労力を増やす方がコストが安くなります。
-
Luna の核となる利点は、究極のユニット エコノミーと速度です。完全な 105 万トークン コンテキスト、コンテキスト長の追加料金なし、1 秒未満のウォームアップ リカバリ、「JSON のみ」などの厳密な形式への高い準拠、バッチ分類と要約が最初のラウンドで正確に完了できます。その主な制限は次のとおりです。真の複数ステップの厳密な推論という点では、ファミリーの最下位にあります。微調整はサポートされておらず、ネイティブ オーディオがなく、ChatGPT アプリのコンシューマー バージョンでは直接選択できず、独立した SWE ベンチ検証済みランキング リストに提出されていません。長いコンテキストの取得能力 (512K ~ 1M) が大幅に低下しており、数十万のトークンにわたる正確な取得を必要とする負荷には適していません。チャートとレイアウトの分析は、全世代のモデルに共通する弱点です。まとめると、Luna は主力製品の代替品というよりは、「タスクのステータスに応じたルーティング」システムの高スループット コンポーネントです。
-
サードパーティの実際のテストでは、一般的に肯定的な評価が得られます。ThePlanetTools の API テストでは、Luna に 8.6/10 の評価を与え、「生のインテリジェンスの最後の数点よりもサイズと速度が重要な場合の最初の選択肢」と呼んでいます。ポリシー文書の要約、リリース電子メールの作成、作業指示のバッチ分類、ウォームアップ応答を適切に実行します。開発者コミュニティは、これを「狭い並列化可能なタスクのための高速かつ安価なワーカー」と要約しています。しかし、コンセンサスによる注意点もあります。ベンチマーク データは主にリリースの初期段階から取得されたものであり、方向性の参照としてみなし、独自の負荷で検証する必要があります。 Luna は中国語を書くのに「十分」です (中国語のトレーニングがデータの約 28% を占めています)。すべてのリクエストに Sol を使用すると、複雑なシーンの品質が低下します。また、すべてのリクエストに Sol を使用すると、請求書自体がアーキテクチャ レビュー レポートになってしまいます。ほとんどの意見は、間違ったモデルの選択は、多くの場合、モデル自体ではなくルーティング戦略に問題があると考えています。
-
- OpenAI公式発表:GPT-5.6シリーズ(https://openai.com/zh-Hans-CN/index/gpt-5-6/) - OpenAI ヘルプセンター: GPT-5.6 Sol、Terra、Luna プレビュー (https://help.openai.com/zh-hans-cn/articles/20001325-a-preview-of-gpt-56-sol-terra-and-luna) - 新華社通信: OpenAI、GPT-5.6 シリーズ モデルを発売 (https://www.163.com/dy/article/L1FPS77G05346RC6.html) - China Daily: OpenAI が GPT-5.6 シリーズ モデルを発売 (https://cn.chinadaily.com.cn/a/202607/10/WS6a509d35a310d709c2fbcddb.html) - マシンの心臓部: GPT-5.6 は完全にオンラインになり、Codex は統合され、ChatGPT Work はここにあります (https://c.m.163.com/news/a/L1FKQ07B0511AQHO.html) - 人工分析知能指数と速度ランキング (https://modelgrep.com/models/openai/gpt-5.6-luna) - ThePlanetTools 実際のテスト評価 (https://theplanettools.ai/tools/gpt-5-6-luna) - Apifox GPT-5.6 の価格詳細 (https://apifox.com/apiskills/gpt-5-6-ding-jie-xiang-jie-sol-terra-he-luna-de-cheng-ben-ji-sheng-qian-gong-lue-2) - PoloAPI の 3 レベルのルーティングの提案 (https://poloapi.com/poloapi-blog.html?slug=How-to-choose-between-three-levels-of-GPT-5.6) - Neodrop GPT-5.6 パブリックオープニングバージョンの解釈(https://neodrop.ai/zh-cn/post/qcoqpKwFH2L)
ユーザーレビュー
-
AliceJackson—同社のバッチ サマリー パイプラインは Luna に切り替えられ、問題なく 1 日稼働しました。コストは従来の月額3,000元から1,000元未満に引き下げられた。節約された予算は、さらにいくつかの方向に使用できます。ただし、比較のために Sol を使用して同じデータを実行したところ、Luna では要約の情報密度にギャップがあることがわかりました。重要な詳細が失われることもありましたが、利点はボリュームが大きく、スピードが速いことでした。 -
hAROLD17—今日、分類タスクに Luna を試してみましたが、基本的に 1 秒以内に応答し、非常に高速でした。しかし、複雑なロジックを無視すると、その臆病さが現れます。よくわからない場合は、Terra に行く必要があります。 -
DennisPhillips_88—以前は情報抽出に Opus 4.8 を使用していましたが、現在は Luna に切り替えています。品質はあまり落ちず、価格は4分の1以下に下がりました。価格性能比は本当に法外です。唯一の問題は、Luna がネストされた JSON 構造を抽出するときにフィールドを失うことがあるということです。その後、プロンプトに詳細なスキーマの例と必須フィールドのチェックを追加しましたが、それ以降は基本的に問題は発生しませんでした。 -
JJimenez_66—Luna のコンテキスト ウィンドウには実際には 100 万個のトークンがあります。プロンプト キャッシュを使用すると、長いドキュメントの処理がほぼ無料になります。 -
EVsmi—Luna は顧客サービスの会話で意図認識を実行し、平均応答時間は 600 ミリ秒を超え、これは以前のモデルの 2 倍の速さです。特にボリュームが大きい場合、経験の違いが顕著になります。 -
47wi8—最初、Luna は単なる縮小バージョンだと思いましたが、実際にテストしたところ、ツール呼び出し、構造化された出力、推論の労力など、必要なツールボックスはすべて備えていますが、推論の深さには限界があります。 -
CPatel_2024—最も人気のあるのは、Luna に完全なエージェント ツール スタックが付属しており、低予算で RAG パイプラインを実行できることです。ナレッジ ベース全体の質問と回答のペアは、Luna によってバッチ生成されます。 -
MoonMoonMiller—Luna は、単純な Q&A やコピーライティングの生成には完全に適していますが、競合製品の分析を行うには明らかに Terra ほど優れていません。生成された構造は浅く、寸法が不完全です。 -
骑士915—Terminal-Bench 2.1 では Luna が Terra よりも高く、これには驚きました。ルナが強いというわけではなく、テラがこの分野では平均的であるということです。 -
月光_25—簡単なタスクには Luna、中程度の難易度のタスクには Terra、難しいタスクには Sol を使用して、ルーティング レイヤーを作成しました。 1 か月でトークンのコストは 60% 減少しました。現時点では、第 3 レベルの層別化の価値が最も明白です。 Luna はリクエストの約 70% を処理しますが、オーバーヘッドは請求額全体の 20% にすぎません。これは、上司にさらなる AI 実験に予算を割り当てるよう説得するのに十分です。 -
Megan_Torres_7—Luna は非常に高速で、Sol の約 3 倍高速ですが、使用する際には注意が必要です。これは単に最も安価なオプションであり、すべてではありません。 -
NodeKpng—バッチテキスト分類は Luna を使用して完全に実装されており、精度は GPT-5.5 を使用したときとほぼ同じです。しかし、請求額は 3,000 ナイフから 600 ナイフに直接下がり、上司は非常に満足しました。しかし、落とし穴があります。Luna は、複数ラベル分類タスクにおいて単一ラベルほど安定していません。その後、プロンプトに並べ替えの制約が追加され、精度は以前のレベルに戻りました。 -
Adam.King_66—ルナの長い文脈は迷信であるはずがありません。あるレビューでは、その長いコンテキストは 41.3% にすぎないと述べています。これを使用して 80,000 トークンのドキュメントを読み取りましたが、多くの詳細が失われました。 -
MargaretKim_2020—Luna は、コンテンツ レビュー パイプラインを構築するための素晴らしいツールです。安くて速くて、精度も許容範囲内です。信頼区間を超えるものは手動で再ルーティングされ、全体の効率が大幅に向上します。 -
DhruvPatil—正直に言うと、この価格戦略は非常に賢明です。ルナは実行量を担当し、テラは日常のタスクを担当し、ソルは最も困難なタスクを担当します。難易度に応じてルーティングすると、総コストは半分以下になります。計算してみたところ、私たちのチームは GPT-5.5 を月額約 8,000 ドルで使用していたことがわかりました。第 3 レベルのルーティングに切り替えた後、コストは 3,000 ドル未満に削減されました。さらに、小さなタスクにおける Luna の実際のパフォーマンスは、5.5 のパフォーマンスと本質的に変わりません。 -
萧晨飞—Luna は低価格ですが、現時点では微調整がサポートされていないため、モデルをカスタマイズしたい企業にとっては欠点です。将来的に追加できることを願っています。 -
JHernandez_2024566—実際、Luna の最もコストパフォーマンスの高い用途は、プロンプト キャッシュのテスト環境として使用することです。システムプロンプトの言葉を変更して、お好みに合わせて試してみてください。 10,000 ラウンドの実行にかかるコストはわずか数元で、デバッグ コストはゼロです。 -
CarolynPowellZ—コードレビューのために Luna を試した後、単純なコードスタイルの問題や明らかなバグを見つけることはできますが、デザインパターンやパフォーマンスの最適化に関連する提案はあまり洞察力に欠けます。 -
BillyWhiteIII—Luna の最大の欠点は、コンシューマー版 ChatGPT では選択できないことです。 APIかChatGPT Work経由でしか使えず、個人ユーザーには不親切すぎる。 -
Zachary.CampbellX—今日、Luna を自動カスタマー サービスに接続しました。電話の件数は1日に数十万件あり、基本的には対応が遅れることはありません。場合によっては、答えが質問の内容と異なる場合もありますが、検証を追加すると、基本的には解決できます。ただし、1 つの問題は、Luna が複数ラウンドの対話における文脈のずれを処理するのがあまり得意ではないことです。 3~4ラウンドで簡単にコースアウトしてしまう。安定化する前に圧縮するために、その前にコンテキスト サマライザーを追加しました。 -
曾建—小規模チームにとって朗報です。以前は、GPT-5.5 を使用した場合の毎月の API 請求額は数千円高かったです。現在、トラフィックのほとんどは Luna を経由し、請求額は 2,000 未満に下がり、コア機能は削減されていません。 -
Dkmit—Luna は電子メール テンプレートの生成が非常に効率的であるため、数千のマーケティング電子メール コンテンツのバリエーションを 10 分間で実行するのにかかる費用はわずか数セントです。リリース前、インターンは丸一日働くよう特別に手配されなければならなかった。 -
AdamBaileyIII—$6/1M トークンを出力し、バッチを使用してさらに 50% 割引を受けます。 Luna での典型的なサマリー タスクのコストは 1 回あたり約 0.0002 セントと計算されましたが、これは無視できる程度です。 -
Jonathan_Simmons0071—ネイティブ オーディオをサポートしていないのは残念ですが、プレーン テキストの高スループット シナリオではオーディオは使用されません。 -
BlockReward736—一言で言えば、Luna はシンプル、安価、予測可能なモデル、Terra は通常のビジネスのモデル、Sol は複雑なインテリジェンスのモデルです。 1 つのモデルにすべての作業を任せないでください。 -
KeithCooper37—プロジェクトの初期段階ではすべてのプロトタイプ検証に Luna が使用され、高速かつ経済的です。製品の方向性が決まってから、より高価なモデルに切り替えるかどうかを決定できます。この段階的な戦略は起業家チームの間で共通であるべきです。 -
BullRunMeyer—再試行ロジックに「失敗したらまず Luna をアップグレードし、次に Terra/Sol をアップグレードする」を記述しました。問題がある場合は、自動的に別のレベルにジャンプし、非常にスムーズに操作できます。 -
ticklishmeercat996—Luna はシリーズ中最も安価なモデルですが、Opus 4.8 を上回るという事実は、軽量モデルのボトムラインが非常に高いことを示しています。 -
Debra525—最初のトークンには 1.4 秒かかり、ウォームアップ時間は 658 ミリ秒です。この速度は、リアルタイムの対話には十分です。 -
PMorgan_66—ExploitGym での Luna のパフォーマンスは、基本的なセキュリティ フィルタリングには十分であることを示しています。推論強度にはまだ改善の余地がありますが、重量級のセキュリティ スキャンには依然として Sol が必要です。