Muse Spark 1.1
Meta 超级智能实验室推出的旗舰多模态推理模型,专为 Agent 任务与编程打造,百万 token 上下文,价格仅为同级竞品四分之一
詳細レポート
-
Muse Spark 1.1 は、2026 年 7 月 9 日にメタ スーパー インテリジェンス研究所によってリリースされた新しい主力マルチモーダル推論モデルです。これはエージェント タスク用に特別に構築されており、ツールの呼び出し、コンピューター操作、プログラミング、およびマルチモーダルの理解に焦点を当てており、100 万トークンのコンテキスト ウィンドウを備えています。また、Meta の初の有料開発者インターフェースである Meta Model API の価格は、入力トークン 100 万件あたり 1.25 米ドル、出力 100 万件あたり 4.25 米ドルで、同レベルの競合製品の約 4 分の 1 です。これは、OpenAI と Anthropic に対する価格戦争として広く解釈されています。ザッカーバーグ氏は 3 年以上ぶりに X プラットフォームに直接戻り、Meta がオープンソースの Llama 路線からクローズドソースの課金モデルに大きく移行したことを示しました。このモデルは、ツール呼び出しやプロのシナリオ テストで多くの初勝利を収めましたが、ターミナル ベンチのランキングに関する論争やクライアントの安定性に関する苦情も伴いました。
-
Muse Spark 1.1 は Meta Superintelligence Labs から提供されており、AI チームを再編成し、密猟に多額の投資を行った後の Meta の最初の画期的な成果です。リリース当日、ザッカーバーグ氏は 3 年以上ぶりに X に投稿し、X を「非常に低価格の強力なエージェントとプログラミング モデル」と呼んだ。マスク氏はすぐに反応し、二人のやりとり自体がニュースになった。アナリストは、競合他社のプラットフォームで公式発表を行うという選択は、意図的なコミュニケーション戦略であると考えています。 このリリースの戦略的重要性は、単なるモデルの反復以上に大きくなります。 Meta は以前はオープンウェイトの Llama シリーズで知られていましたが、Muse Spark 1.1 はクローズドソース モデルであり、有料 API を通じて初めて外部利用に商用利用できるようになりました。これは、Meta が OpenAI や Anthropic が位置するエンタープライズ レベルのモデル課金市場に正式に参加したことを意味します。 Sina Financeなどのメディア報道によると、Metaは同時期に自社開発のAIチップ「Iris」計画も立ち上げ、Broadcomの設計やTSMCの製造と協力してNvidiaやAMDへの依存を減らし、来年のコンピューティング能力を2倍にするという目標を支援しようとしている。このモデルは、WhatsApp、Instagram、Facebook、スマート グラスの Llama を利用したチャットボットを徐々に置き換え、数十億のユーザーからなる Meta の製品マトリックスをカバーします。
-
Muse Spark 1.1 は、テキスト、画像、ビデオ、オーディオ、およびファイル入力をサポートするマルチモーダル推論システムであり、前世代の 4 倍である 1,048,576 トークンのコンテキスト ウィンドウを備えています。ユーザーの目標に基づいてタスクを計画し、外部ツールを呼び出し、コードを記述してデバッグし、複数ステップの長いフローのタスク全体にわたってコンテキストを維持できます。メタ氏は、このモデルは「自動化するスクリプトをいつ書くべきか、いつインターフェイスを直接クリックすべきかを知っている」と述べた。複数のアプリケーション間を行き来してタスクを実行でき、不慣れなインターフェイスに直面した場合でも手動介入は最小限で済みます。 マルチエージェント自動ワークフローの場合、モデルではコンテキスト圧縮メカニズムが導入されています。メイン エージェントはプロジェクト計画の生成を担当し、サブエージェントは個別に実行されます。実行プロセス中に生成される大量のデータは、最も重要な詳細を保持するために圧縮されます。必要に応じて、以前の作業結果を追跡したり、異なるサブタスク間で情報を転送したりできます。この設計は、エージェント ワークフローにおける「コンテキスト爆発」の問題点に直接対処します。 Meta の社内デモンストレーションでは、エンジニアはプロンプトに基づいてチャット アプリケーションを生成するように依頼しました。このモデルは、プログラム インターフェイスのスクリーンショットを自動的に取得し、技術的な問題を特定し、修復するために誤ったコード スニペットを特定できます。マルチモダリティの観点では、ユーザーが撮影したビデオに基づいて製品情報を抽出したり、ユーザーに代わって Facebook の中古市場で製品のリリースを完了したり、コードを生成しながら食品の注文などの実践的なタスクを完了したりすることもできます。 コミュニティテストからのフィードバックは概して肯定的です。オープンソース開発者の Simon Willison は、数日間プレビュー アクセスを取得した後、古典的な「自転車に乗るペリカン」の SVG テストを行い、2 人のミューズ スパークが互いに会話し、その存在について語るモデル評価レポートのクリップに深い感銘を受けました。 Julius AI の創設者は、Minecraft ゲーム プロジェクト全体をコード ワークベンチで直接記述して実行できるようにしています。また、写真内の食べ物が食べられるかどうかをモデルに判断させる画像認識をテストしているユーザーもいます。 Muse Spark 1.1 はテストに合格しましたが、コントロールの Claude Fable 5 は不合格でした。
-
価格設定は、このリリースの最も鋭い武器です。 Meta Model API のパブリック プレビュー バージョンは、米国の開発者に公開されています。料金は入力トークン 100 万あたり 1.25 米ドル、出力トークン 100 万あたり 4.25 米ドルで、GPT-5.5 や Claude Opus 4.8 と同じレベルの製品の約 4 分の 1 です。新規ユーザーには 20 米ドルの無料クレジットも付与されます。 Sina Finance によると、その入出力コストは Anthropic や OpenAI 製品より 50% 以上低いです。この自信は広告事業の利益サポートによってもたらされており、メタ社の営業利益は 2025 年に 20% 増加し、2026 年には 30% に加速する見込みです。 コミュニティの議論では、これは純粋な能力の進歩ではなく、何よりもまず価格競争であると一般的に考えられています。 Hacker News の開発者は、キャッシュされた入力価格の重要性を繰り返し強調してきました。その理由は、複数ラウンドのプログラミングとエージェント ワークフローで多数のコンテキストが再利用され、キャッシュされた価格が実際のコストを直接決定するからです。 1 日に何十万ものエージェント呼び出しを実行するチームにとって、出力あたり 4.25 ドルの価格により、大規模なエージェントのバッチ処理が経済的に実現可能になります。ビジネス路線では、Meta は低価格の API を使用して開発者を引きつけ、モデルを自社の消費者向け製品に組み込んで (Meta AI アプリケーションには「思考」モードが追加されています)、B サイドと C サイドの二重収益化を形成しています。
-
肯定的なレビューは、ツールの呼び出しと長いコンテキストに焦点を当てています。多くの開発者は、ツール呼び出しの成功率が GPT-5.5 エージェント リンクの最初のラウンドよりも高いと報告しています。最も有望なシナリオは、デバッグ、診断、およびインシデント対応です。最初にログを grep し、パフォーマンス分析を実行し、レポートを整理して、その結果を修復のためにより強力なモデルに渡します。 100 万トークン ウィンドウは、実際のテストでのストレス テストに耐え、タイルや要約を必要とせずに、大規模なコード ベースや複数ファイルの検索にわたって安定したパフォーマンスを発揮します。 否定的な意見もたくさんありました。新モデルを搭載したMeta AI iPadクライアントは、頻繁にクラッシュしたりテキスト出力が文字化けするなど、安定性が非常に悪いと一部ユーザーから不満の声が上がっていた。また、Meta AI では通常の Excel テーブルさえ作成できないと不満を漏らす人もいます。開発者の中には、全体的な品質がクロード ソネット シリーズほど良くないと率直に述べた人もいます。 「ツールを強力に使用しても、全体的な品質が向上するわけではありません。」よほど品質が安定していてトップレベルに近いものでない限り、まだ評判が上がっていない新モデルでこの価格は決して安いものではないと考える人もいるでしょう。
-
サードパーティのベンチマーク テストでは、その機能の概要が示されています。エージェントでは優れており、プログラミングでは劣っていませんが、すべての側面で最高というわけではありません。 Meta が発表した内部テストでは、MCP Atlas ツール呼び出しテストのスコア 88.1 で第 1 位にランクされ、Claude Opus 4.8 の 82.2 や GPT-5.5 の 75.3 を上回りました。また、JobBench プロフェッショナル シナリオ ツールの使用テストでも 54.7 のスコアで 1 位にランクされました。コンピューターの操作に関しては、OSWorld-Verified のスコアは 80.8 で、Opus 4.8 の 83.4 に次いで 2 番目でした。 Terminal-Bench 2.1 は 80 ポイント、SWE-Bench Pro は 61.5 ポイントを獲得しました。 Vals AI リストによると、総合指数では 4 位 (精度 68.41%)、マルチモーダル指数では 6 位にランクされています。金融代理店および企業財務分析試験で 2 位、医療記録処理で 1 位、法律、税務、医療文書の 3 つの垂直業界試験すべてで 1 位を獲得しました。 1位であり、司法書士業務とは明らかな差がついている。人工分析インテリジェンス指数は 3 か月で 8 ポイント増加し、スコアが 50 を超える 4 つの最先端のモデルに加わりました (他のモデルは GPT-5.5、Opus 4.8、および Kim K3)。 メディア解釈の焦点は戦略レベルにあります。 Zhidongxi、TechCrunch、その他のメディアは、これをメタにとって「エコロジーのためのオープンソース」から「クローズドソース課金」への分水嶺であり、AIプログラミングツール市場の新たな変数であるとみなしている。業界アナリストは一般に、ユーザーとエクスポージャーと引き換えにMetaの積極的なトークン価格設定が、短期的にはAnthropicとOpenAIのエンタープライズ顧客見積もりに真の圧力をかけるだろうと信じている。
-
最大の技術論争は、ターミナルベンチのランキングスキャンダルです。一部のコミュニティ メンバーは、Meta がベンチマークの実行時にリソース構成を調整したことを発見しました。これにより、リソース構成を変更した後もスコアが同じベンチマークを表すことができるかどうかについての議論が引き起こされました。一部の開発者はこれに基づいて公式スコアを割り引いています。第二に、信頼性に関する疑問があります。Meta は、2026 年末までにコンテンツ レビュアーの 90% を AI に置き換えることを計画しています。先月、Meta の AI カスタマー サービス エージェントが誤って約 20,000 の Instagram アカウントへのアクセスをハッカーに与えていたと報告されました。同社はユーザーに代わって行動できるエージェントの採用を推進しているが、この歴史により部外者は同社のセキュリティ管理能力に警戒するようになった。 ルート変更自体にはコストがかかります。オープン ウェイトを放棄すると、自己デプロイメントで Llama に依存しているコミュニティは見捨てられたように感じられ、プライベート デプロイメントまたはオープン ソース ウェイトが必要なチームは、Llama シリーズに頼るか、または Kim K3 などのオープンソースの代替手段に切り替えるしかありません。さらに、投資界はメタの「多面的な攻撃と焦点の欠如」について依然として疑問を抱いている。自社開発チップ、超インテリジェント研究所、メタバースはすべて同時に進歩しており、それが短期的に設備投資を押し上げるだろうし、メタバースから学んだ教訓はまだ残っている。
-
このモデルは、MCP マルチツール オーケストレーション、クロスアプリケーション自動化、ロングコンテキスト コード ベース Q&A、大容量エージェント呼び出し、その他のシナリオなど、エージェント ワークフローを構築する開発チームに最適です。その成功率と単価の組み合わせでは、現在の市場ではほとんど競合するものがありません。予算が厳しく、問い合わせ件数が多いスタートアップ企業や独立系開発者も試してみる価値があります。完全な評価を完了するには、20 ドルの無料クレジットで十分です。逆に、極端なコード機能を追求するチームは依然として Claude Opus 4.8 を使い続ける可能性があります。オープンソースの重視、ローカル展開、またはドメイン外にデータを出さないことを必要とする企業には適していません。これは、民営化パスのない純粋な API のクローズド ソース製品です。一般ユーザーはメタ AI アプリケーションの「思考」モードで無料で体験できますが、現在のクライアントの安定性の問題は完全に解決されていないため、重要な作業に依存することはお勧めできません。
-
Muse Spark 1.1は、メタ社が「四半期価格+エージェントのロングボード」でエンタープライズAI市場に正面から攻撃を仕掛けた製品だ。その評判を維持できるかどうかは、偽リスト論争の解明と実際の運用環境での信頼性パフォーマンスにかかっています。短期的には、最先端モデルの価格基準を少なくとも 1 段階引き下げた。長期的には、メタ社の自社開発チップと広告キャッシュフローの組み合わせにより、この価格競争は敵対者が予想するよりも長く続く可能性がある。
ユーザーレビュー
-
Janet_Green007—Meta は、年末までにコンテンツ モデレーターの 90% を AI に置き換える予定です。先月、AIカスタマーサービスが誤って2万件のInstagramアカウントにハッカーに権限を与えていたことが明らかになった。現在、ユーザーに代わって動作できるエージェントが導入されています。安全管理に疑問を感じます。 -
Benjamin_RamirezSr—ストレス テストでは、マルチファイル コード ベースでの 1M コンテキストの検索パフォーマンスは非常に安定していました。アクティブ コンテキスト圧縮は長時間セッションの品質をサポートし、エージェント ループ コマンドは 1 時間実行した後でもクラッシュしませんでした。オーディオおよびビデオ入力も受け入れることができます。同じ価格帯の GPT-5.5 も Opus 4.8 も、この入力範囲に完全に対応することはできません。マルチモダリティは静かな差別化要因であり、全体的には予想よりもはるかに優れています。 -
kc7fg—オープンソースの重要性またはローカル展開が必要な場合は、終了できます。これは、民営化パスのない純粋な API のクローズド ソース製品です。セルフホストする場合は、Llama または Kim K3 のみを使用できます。このモデルを作成する超知能研究所と Llama オープンソース チームは別々に動作します。 1 つは有料の最先端のパフォーマンスに特化しており、もう 1 つは引き続きオープンソースです。メタは二本足で歩きますが、データがドメインの外に出ることができない企業には選択肢がないことを意味します。 -
TokenTiger152_eth—要約すると、毎日 500 件の顧客サービス会話を処理し、通話ごとに平均 40,000 の入力トークンと 3,000 の出力トークンを処理する運用エージェントは、Muse Spark 1.1 を実行するのに 1 日あたり 31 ドル強、これは月額 900 ドル以上かかります。 GPT-5.6 Sol では同じ作業に 1 日あたり 145 米ドルかかります。ツールを大量に使用するビジネスにとって、この価格差はコストの節約ではなく、ビジネス モデルの直接の変化につながります。 -
MMorales_9990—公式の比較は GPT-5.5 と Opus 4.8 の間であることに注意してください。新世代はリリースと同じ週にリリースされました。前世代を対照グループとして使用するのが一般的ですが、それらを参照するときはスコアに注意する必要があります。 -
MetcPro—1.0 から 1.1 までの期間はわずか 3 か月で、内部テストの合格率 @1 は 48.1% から 67% に上昇しました。この反復速度はちょっと怖いです。 -
ERuiz_7744—1M ウィンドウは実際のものですが、MRCR ロング コンテキスト取得スコアはわずか 54.1 です。ウィンドウが長いからといって、検索が正確であるとは限りません。数百万のトークンが満たされた後、重要な情報の呼び出しは最先端のレベルには達していません。重要なシーンは依然として自分で検索する必要があります。 -
AnthonyRamirez—この API は米国外では一時的に利用できず、欧州連合にはスケジュールさえありません。海外チームはまだアーキテクチャに賭けるべきではありません。新規ユーザーには 20 ドルのクレジットが付与され、これにより完全な評価には十分な約 470 万個の出力トークンを生成できます。 -
RBaileyJr—幻覚率は欠陥です。人工分析では 38% が測定され、これはこの世代のモデルの中でほぼ最高です。私自身、これを率直なファクトシートとして目にしました。エージェントのリストではトップですが、純粋なプログラミングの SWE-Bench Pro 61.5 は Opus 4.8 の 69.2 に負けます。さらに、よくしゃべるので、答えを得るまでに平均よりも多くのトークンを消費します。実際のコストと応答時間が長くなり、重要な回答は自分で確認する必要があります。 -
MarilynMyersX—ツール呼び出しは非常に強力で、MCP の実行中にビートを逃すことはほとんどありません。 -
PinjaWalli—速くて安くて使いやすいですが、王様ではありません、速いですが最速ではありません、スマートではありますが最もスマートではありません。 -
Amy_Hill369—スクリーンショット主導のデバッグのデモンストレーションは非常に素晴らしいです。独自のチャット アプリケーションを構築し、自動的にスクリーンショットを撮ってインターフェイスを確認し、コードの特定の行までバグを追跡します。修正後、スクリーンショットを撮って確認します。このチェック、変更、検証の閉じたループは、フロントエンド開発にとって非常に実用的です。サンドボックスのデモもありますが、これには run と write_file の 2 つのツールと 1 回限りの Docker コンテナーのみが提供されます。 SWE ベンチのバグを修正するために 48 個のシェル コマンドをすべて選択します。また、git 履歴を検索して、問題を引き起こしたコミットを見つけます。提供する必要があるのはコンテナとターゲットのみであり、スクリプトは必要ありません。 -
DianeHern_andez—Llama のオープンウェイトからクローズドソースの有料 API に至るまで、Meta のターンは十分に徹底されており、自己展開のために Llama に依存していたコミュニティは今回放棄されました。さらに、新しいモデルは、WhatsApp、Instagram、Facebook、スマート グラスの Llama 主導のチャットボットを段階的に置き換える予定であり、これは数十億のユーザーを抱える製品マトリックスの完全な見直しに相当します。オープンソース路線は大きく変わったようだ。 -
crazypeacock280—今回のメタは普通のモデルアップデートではありません。直接的にはAIプログラミングツール市場をターゲットとしています。コードの脆弱性を修正し、大規模なコードの移行を実行し、複数のアプリケーションにわたってツールを調整できます。プログラミングツールを作る人は緊張するはずです。 -
AdrijanaKapetanović—API は OpenAI 形式と完全に互換性があります。 Base_url を api.meta.ai/v1 に変更するだけでモデル名を変更できます。既存のコードには基本的に手を加える必要はありません。移行コストはほぼゼロです。 A/B テストを実施したいチームは、直接テストに参加できます。 -
xMiljaPeura_dev—Terminal-Bench スコアは物議を醸しています。ベンチマークの実行中にリソース構成が変更されました。構成を変更した後のスコアは同じベンチマークを表すことができますか?予約があります。 -
JaniceBrown—最も有望な用途はデバッグとインシデント対応です。まず、ログを grep させ、プロファイラーを実行し、レポートを整理し、その後、修復のために結論をより強力なモデルに渡します。ツール呼び出しは何百回、何千回も行われる可能性があり、1 回の失敗率がわずか数パーセントであっても、累積的なトークン コストとタイムアウトは相当なものになります。幸いなことに、bash や HTTP などの一般的なツールは、基本的に検証と再試行に依存することで生き残ることができます。 -
Web3Kine—画像認識テストでは、写真に写った食べ物が食べられるかどうかを判定しました。正しく答えてくれました。クロード・フェイブル 5 も同じ問題に不合格でした。マルチモダリティは本当に素晴らしいものです。 -
Megan_Brooks_X1—実際に使ってみると、全体的な品質はソネットほど良くありません。ツールを強力に使用しても、全体的な品質が向上するわけではありません。リストに頼ってリズムに導かれないようにしてください。 -
冬雪_4—重要なのは、キャッシュされた入力の価格です。コーディングとエージェントのワークフローを複数ラウンド行うと、大量のコンテキストが再利用されます。キャッシュ価格が低いことが実質的な節約になります。値段だけ見ても意味がありません。 -
LawrenceMorales_2021—モデルと API は同じリリース フレームワークでプロモーションされており、価格戦争の兆候はあまりにも明らかです。メタは広告キャッシュフローを利用してモデルに補助金を出している。入力コストと出力コストは、Anthropic や OpenAI よりも 50% 以上低くなります。広告事業の営業利益は2025年にも20%増加する見通しで、弾みは十分にある。同時に、TSMCが設計・製造したBroadcomの自社開発チップIrisも正式に発表され、Nvidiaへの依存度を減らしたいとの意向を明らかにした。 OpenAI と Anthropic の間のこの戦いは本当に難しいです。 -
heavydog556—価格設定を読んだ後、私はいくつかのエージェントプロジェクトの請求額を手元に再計算しました。インプットは 1.25 で、アウトプットは 100 万トークンあたり 4.25 米ドルで、これは同じレベルの競合製品の約 4 分の 1 に過ぎません。超個人のコスト構造は本当に変わります。 -
SGarcia_88944—何者かが、Julius のコード ワークベンチで直接「Minecraft」ゲーム プロジェクト全体を作成して実行することができました。私は唖然としました。 -
史琪—Xiao Zhaが3年ぶりにXに戻ったときの最初の投稿は、このモデルを正式に発表することでした。彼はまだマスクの領域にいて、その言葉を広めようと強い決意を持っていました。 -
EGutierrez_88—iPad版メタAIは安定性が悪すぎます。頻繁にクラッシュし、出力テキストが文字化けして壊れます。モデルがどれほど強力であっても、クライアントは依然として無駄です。 -
Diana.Sanchez_770—Simon Willison は、古典的な Pelican Cycling SVG テストを行うための数日間のプレビュー アクセスを取得しました。評価レポートの中で、ミューズ・スパークの二人が自らの存在について語った部分が特に興味深かったとのこと。読み終わってから原文も読みました。本当に楽しかったです。 -
Christian.Perry9—それを普通の Excel スプレッドシートに変換すると、ひっくり返ります。それでは、私たちが合意したエージェントは何でしょうか?