Cognition SWE-1.7
Cognition 基于 Kimi K2.7 Code 训练的软件工程智能体模型,逼近前沿、成本大降
詳細レポート
-
Cognition (Devin の親会社) は、2026 年 7 月 8 日から 9 日にかけて SWE-1.7 をリリースしました。これは、これまでにトレーニングした中で最も強力なソフトウェア エンジニアリング エージェント モデルです。 Moonshot AIのオープンソースモデル「Kimi K2.7 Code」をベースに、Cognitionが自社開発した大規模強化学習ポストトレーニングを重ね合わせ、Devin環境での長期非同期タスク向けに直接調整している。同関係者は最強のクローズドソースモデルを完全に上回るとは主張しなかったが、導入可能な範囲を「数ポイント劣り、一桁安い」とセールスポイントに置いた。自作の FrontierCode ベンチマークでの単一タスクのコストは約 1.97 米ドルです。すべてのベンチマーク数値は Cognition 独自のレポートからのものであり、サードパーティによる独立した再テストはまだ行われていません。
-
Cognition は、独自のソフトウェア エンジニアである Devin を構築したことで最もよく知られている応用 AI ラボです。その SWE モデル ファミリは、エージェント ソフトウェア エンジニアリング作業用に特別に設計されています。これは、Devin の Web、デスクトップ、CLI の 3 つの端末を通じて提供され、長期にわたる非同期コーディング タスク向けに最適化されています。 SWE-1.7 は、公式に文書化されたこのファミリーの最初のバージョンです。以前のバージョンは、2025 年 10 月にリリースされた SWE-1.6 でした (モデルのエクスペリエンスと速度に重点を置き、3 か月間無料でした)。同社のチームは小規模ですが、高密度です。創設メンバーは 10 個の IOI 金メダルを保持しており、Cursor、Scale AI、Modal、Google DeepMind などの機関から来ています。
-
SWE-1.7 は、Devin プラットフォーム内でホストされた形式でのみ提供されます。オープンソースの重みはリリースされず、独立したモデル API もありません。これは、AI チップ企業 Cerebras が提供するコンピューティング能力と、毎秒最大 1,000 トークンの推論速度を備えた Devin の 3 つの端末で利用できます。トレーニング レシピには 4 つの重要なコンポーネントがあります。1 つはエントロピーの保存で、top-p サンプリングとサンプリング分布の再生を使用してトレーニングと推論の間の KL 発散不一致を解決し、Muon オプティマイザーと連携してトレーナーの非決定性を排除します。 2 つ目はマルチクラスター トレーニングで、3 大陸の 4 つのデータ センターにまたがり、トレーナーが集中し、推論エンジンが分散され、圧縮重み増分量が 99% 以上削減され、1 ~ 2 分の大陸間同期が行われ、推論障害は NVIDIA Dynamo Re-routing によって解決されます。 3 つ目は、高品質のデータ プランニング、テストの自動実行、学習シグナルの低いタスクのフィルタリング、報酬ハッカーの防止です。 4 つ目は、ロングスパンのセルフコンパクション (セルフコンパクション) です。コンテキストが限界に近づくと、モデルはそれ自体を要約して実行を継続します。 1 回のロールアウトは最大 6 時間続く可能性があり、単純なタスクの冗長性を圧縮するために交互の長さのペナルティと組み合わせられます。動作の点では、Kimi K2.7 ベースと比較して、変更を加える前により探索的なコード読み取りを実行し、より凝縮された推論チェーンを提供し、根本原因レベルの欠陥修復を実行します。
-
SWE-1.7 は個別に販売されておらず、その機能は Devin サブスクリプションによって提供されます。価格設定の手がかりの一部は Windsurf Cascade のドキュメントから得られます。SWE-1.7 Lightning の価格は、100 万トークンあたり、入力で 2.50 ドル、キャッシュされた入力で 1.00 ドル、出力で 12.50 ドルです。無料版ユーザーは前世代の SWE-1.6 のみを使用できます。 Devin のようなタスク消費量に基づいて料金が請求される製品の場合、最高スコアを超えてスケールできるかどうかは単価によって決まります。 Cognition は、コア ビジネスの数値としてシングル タスクのコスト 1.97 ドルを強調しています。
-
リリースされたばかりのモデルで、Devin プラットフォーム内でのみ利用可能であるため、ユーザーからの直接のフィードバックはまだほとんどなく、ソーシャル メディアでの議論はスピードとポジショニングに重点が置かれています。開発者の dabit 氏は、1000 tok/s は「非同期エージェントの作業にリアルタイムの感覚を与える」とコメントし、「技術的には非同期ですが、あまりにも速いのでじっと見つめていたくなる」中間状態について説明しました。同氏はまた、推論を増やすと実行時間が長くなるが、変更の影響が増幅されると指摘した。一般に認識されている声は、競争ポイントを「トップスコア」から「コストパフォーマンスのパレートフロント」に移すことであり、これはタスクごとに課金し、大規模なスループットを追求するチームにとって現実的に魅力的です。
-
業界メディアは一般に、その位置付けを「最先端に近いが、桁違いに安い」と受け入れています。複数のレビューでは、FrontierCode 1.1 Main での SWE-1.7 のスコアは 42.3% で、GPT-5.5 の 43.0% や Claude Opus 4.8 の 46.5% よりわずかに低いものの、ベースの Kim K2.7 コードの 30.1% や前世代の SWE-1.6 の 9.4% よりははるかに高いことが指摘されています。 Terminal-Bench 2.1 のスコアは 81.5% (Opus 4.8 では 86.9%)。 SWE-Bench Multilingual 多言語ソフトウェア エンジニアリングでは 77.8% であり、GPT-5.5 の 76.8% を上回っています。結論としては、あらゆる面でクローズドソースの反対者をリードするわけではないが、多言語の汎用性と単価には違いが生じるということです。また、Cognition はこのリリースを利用して、一般的な判断に異議を唱えました。つまり、十分なポストトレーニング後に RL を実行し続けるオープンソース ベースのメリットは、すぐにピークに達します。そして、SWE-1.7 は、複数ラウンドの RL を経た Kim K2.7 よりも大幅な改善を達成しています。
-
最大の論争は、台座の起源から生じます。 Kim K2.7 コードは、中国本土の研究所が開発したオープンソース モデルです。コグニション社は、この目的のために「オープンソース派生モデルの信頼性の測定」という記事を特別に公開し、一連の多言語広報とレビュー評価 (英語/簡体字/繁体字中国語をカバーする 145 の政治的に敏感な質問、質問ごとに 5 つのサンプル、6 つの軸に従ってスコア付け) を使用してモデルの信頼性をテストし、コーディング能力と中立性の両方を備えているため、Kimi K2.7 の選択を強調しました。その後のトレーニングでさらに改善されました。このアプローチは、業界では「地質学的リスクを考慮に入れる」誠実な運営とみなされていますが、同時に購入者に思い出させます。モデルは Devin プラットフォームを通じてのみ提供され、セルフホスティング、厳格なモデル ルーティング、または独自のテクノロジー スタックを持つチームへのアクセスが必要です。アクセス方法自体に制限があります。さらに、すべてのベンチマークは Cognition によって自己報告されており、独立した第三者による再テストがないため、数値は注意して見る必要があります。
-
Devin をすでに導入している、または導入を準備しているチーム、タスク消費量に基づいて請求するチーム、特に最先端モデルの単価によって抑制されるシナリオで大規模なソフトウェア エンジニアリング スループットを追求するチームに適しています。これは、ローカルのセルフホスティング、制御可能なモデルの重み、または独自のアプリケーション スタックへのアクセスを必要とするチームには適していません。これらのユーザーは、GLM や Kim などのオープンソースの重みルートを検討する必要があります。代替手段には、Anthropic の Claude シリーズ、OpenAI の GPT-5.5/Codex、Cursor や Windsurf などのマルチモデル コーディング エージェントが含まれます。
-
SWE-1.7 は、Cognition の「オープンソース ベース + 自社開発 RL + 推論協調設計」のデモンストレーションです。スコアはリストのトップにはなりませんでしたが、コスト曲線を大きく左下に押し下げました。タスクごとに支払いを行うプログラミング代理店製品の場合、これはベンチマークの数パーセントよりも重要になる可能性があります。自己申告された数値がプラットフォームに関連付けられているため、時間をかけて個別に再テストし、テストする必要があるというだけです。
ユーザーレビュー
-
CGonzalez_2024—率直に言って、私が気にしているのは 1 つだけです。修正されるバグが根本原因レベルであるかどうかです。レポートでは、根本原因の修復や、変更を加える前の探索的な読み取りには、ベースよりも優れていると述べています。これは、単純なスコアよりも日々の経験に大きな影響を与えます。以前、他のエージェントを使用していたときは、見た目を変えてテストすることが多かったです。その結果、隣のモジュールも同じ根本原因で爆発しました。これは本当に無駄です。 -
6coch1—ベースに Kim K2.7 コードを選択したこと自体、話す価値があります。オープンソース モデルは、トップ RL チームによって 2 回トレーニングされた後、10 ポイント以上増加する可能性があります。これは、RL の上限に達していないことを示しています。 -
Emma.Martin_X—マルチクラスター RL の大陸間重み増分同期は非常にクールに見えますが、報酬ハッカーを防ぐためのサンドボックス設計の方が心配です。レポートでは、ネットワークの隔離と不正行為に対する報酬ゼロについて言及していますが、これは正しい方向です。 -
StarkNetStarReyes—ターミナルでは、エージェントの動作を 1000 tok/s でリアルタイムに監視できます。この非同期だが高速な「中間状態」は、純粋なバックグラウンド実行体験よりもはるかに優れており、待ち時間の不安が大幅に軽減されます。以前は、長いタスクに負けたら、別のことに切り替えていました。戻ってきて、自分が道に迷っていたことに気づいたとき、もう一度最初からやり直さなければなりませんでした。今では、30 分以内にコードを読み取ってプローブを設定するのがわかり、何か問題があればその場で停止できます。 -
KimberlyKristensen—自己圧縮が最大 6 時間のロールアウトに耐えられることが実際の要件です。他のエージェントを使用して長いタスクを実行すると、コンテキストが爆発して途中で状態が失われることがよくありました。この設計はこの問題に適しています。 -
Michael.ChavezSr474—このスコアの配置は非常に賢明です。トップの座を掴むのではなく、コスト曲線を掴みます。タスクごとに料金を請求し、月に数百件の PR を消化する私たちのようなチームにとって、単価はその数パーセント ポイントよりもはるかに重要です。 FrontierCode タスクのコスト 1.97 ドルが本当であれば、Opus 4.8 などの各ロールアウトのコストと比較すると、スケールアップするとその差はさらに大きくなるでしょう。 -
琉璃448—Cognition の宣伝/検閲に対するアプローチは非常に誠実であり、これは中国のオープンソース ベースを使用していないふりをしている研究所と比較してプラスです。 -
SJacksonSr—すべてのベンチマークは Cognition 自体によって報告されます。 FrontierCode は依然として独自のベンチマークです。サードパーティによる再テストを待ちます。急いで選考レポートに書き込まないでください。特に、OpenAI 自体は、SWE ベンチ汚染の問題を理由に以前に検証済みバージョンを放棄しており、自己報告リストが骨抜きになる余地がたくさんあることを示しています。結論を出す前に、独立した監査結果が出るのを待つほうがより安定的です。 -
Bobby.Johnson520278—オープンソースの重みや独立した API はなく、Devin のみを使用できます。これは私たちにとって欠陥です。セルフホスティングと厳密なモデル ルーティングが必要であり、プラットフォーム バインディングは直接排除されます。 -
PatrickHendersonQ—無料のファイルはまだ SWE-1.6 のみです。 1.7 を試したい場合は、料金を支払う必要があります。チームの 2 人がサブスクライブして、実際のタスクを 1 週間実行してから決定してください。 -
Brenda.Collins346—タスクあたり 1.97 ドルという数字は重要ですが、当社独自の「単一の統合変更コスト」と比較する必要があります。ベンチマークスコアを見るだけでは意味がありません。 -
Jean_Hill_66—Devin で SWE-1.7 に切り替え、2 つの古いウェアハウスの移行タスクを実行しました。それは本当に速く感じられ、1000 tok/s という劣った結果による心理的負担ははるかに軽くなりました。 -
LJonesX—SWE-Bench の多言語対応率は 77.8% で、GPT-5.5 の 76.8% を上回りました。多言語の一般化は実際に違いを生み、言語をまたいだウェアハウスにとって非常に役立ちます。 -
Sawyer530—比較すると、私はこれを「最強のコーディング モデル」というよりは「低コストで長期的なタスク実行ツール」と考えることを好みます。ポジショニングを明確に考えればトップスコアに執着することはなくなる。 -
BPerez_7—SWE-1.6 の 9.4% から 42.3% に跳ね上がり、1 世代で 4 倍に増加しました。この範囲だと、オーパスとのわずかな差よりも、トレーニングフォーミュラの方が気になります。