Riffusion

从 2022 年开源频谱图扩散模型到 Google Flow Music,Riffusion 是对话式 AI 音乐创作平台,用自然语言即可生成带人声与编曲的完整歌曲

詳細レポート

  • Riffusion は AI 音楽生成の分野ではベテランであり、最も劇的なアイデンティティの変化を遂げた企業でもあります。 2022 年末にオーディオに「イメージ拡散」を適用するオープンソースのおもちゃとしてスタートしました。2023 年に 400 万米ドルのシードラウンドを獲得しました。2025 年 7 月に、ProducerAI と名前が変更され、ユーザー数が 100 万人に達しました。 2026年2月にGoogle社に丸ごと買収された。 2026年4月、Google Flow Musicとして生まれ変わりました。現在riffusion.comで見られる製品は、本質的には、Lyria 3、Gemini、Veo、Nano Bananaによって駆動される、Google LabsのGoogle DeepMindの会話型AI音楽作成プラットフォームです。

  • Riffusion はもともと Seth Forsgren と Hayk Martiros のサイド プロジェクトで、2022 年 12 月 15 日にオープンソース化されました。彼らの創意工夫は、微調整された Stable Diffusion v1.5 を使用して「スペクトログラム」上で拡散し、テキスト プロンプトをスペクトログラム画像に変換し、次に逆フーリエ変換を使用してそれを音声に変換することです。時間は画像の横軸であるため、2 次元画像モデルは音声構造もモデル化できます。オリジナルのモデルは MIT ライセンスの下で公開されていますが、生成されるのは約 5 秒のインストゥルメンタル音楽のみで、歌詞はなく、音質も限られています。 口コミで広まった後、二人はこのプロジェクトを商品化しました。 2023年10月、リフュージョンはグレイクロフトが主導し、サウスパーク・コモンズとスカイ9、そして電子音楽グループのザ・チェインスモーカーズがアドバイザーとして参加し、400万ドルのシードラウンドを完了した。それ以来、この製品は何度かの反復を経て、無料で無制限のパブリック ベータ Web バージョンが 2025 年 1 月に開始されました。2025 年 7 月に正式にProducerAI に名前が変更され、自社開発の FUZZ-2.0 モデルに置き換えられ、会話型作成インターフェイスが導入されました。 Googleに買収される前にはユーザー数が100万人を超えていた。 2026 年 2 月 24 日、Google は、Google Labs の製品管理ディレクターである Elias Roman のブログを通じて、ProducerAI の買収を発表し、チーム全体が Google Labs と Google DeepMind に統合されました。これは、Google が最新の音楽モデル Lyria 3 をリリースしてからわずか 1 週間後に発表されました。 2026 年 4 月に、この製品は再び名前が変更され、Google Flow Music として発売され、最下層は Lyria 3 Pro に置き換えられました。 2026 年 5 月に iOS アプリケーションがリリースされ、Google I/O で詳細なセグメント編集が追加されました。 Producer.ai は flowmusic.app にリダイレクトされるようになりましたが、依然として一般的に Riffusion またはProducer AI と呼ばれます。

  • 現在の製品は「会話型」です。ユーザーは、レコーディング スタジオでプロデューサーと会話するのと同じように、Gemini を搭載したプロデューサー エージェントと自然言語でコミュニケーションします。「2 番目の詩のベースを少し難しくして」「歌詞をスペイン語に翻訳して、メロディーはそのままに」。テキスト、画像、オーディオの 3 つの条件入力をサポートしており、ボーカル、アレンジ、歌詞を含む完全な曲を一度に生成できます。 コアモデル Lyria 3 Pro は、レイヤード アテンション メカニズムを採用しており、44.1kHz ステレオで最大 3 分間の完全な曲を生成でき、最初のバースのメロディーの動機をブリッジとアウトロで再現および進化させることができます。この曲に関して、プラットフォームは完全な編集機能を提供します。リミックス、拡張、ステム分離 (ボーカル、ドラム、ベース、メロディーを分離し、従来の DAW で洗練する)、置換およびセグメント編集 (曲全体を変更せずに不満足なセクションのみを変更する)、AI カバー (オーディオの一部をアップロードすると、プラットフォームがその周りの音楽を再配置します)。 さらに特別なものは、スペースとミュージック ビデオです。 Spaces を使用すると、自然言語を使用してまったく新しい楽器、シンセサイザー、エフェクトを作成できます。プラットフォームではこれを「vibe-code」と呼んでいます。コードを記述せずに再生および共有できるブラウザ側のオーディオ ツールを生成できます。現在、同様の機能を提供する競合製品はありません。ミュージック ビデオの場合、Veo または Gemini Omni Flash はトラックのナラティブに基づいてサポート用の短いビデオを生成します。すべての出力には Google の SynthID の目に見えないウォーターマークが埋め込まれており、その AI の起源は synthid.google.com で確認できます。 riffusion.com の初期のオープンソース バージョンは今日の製品とは完全に異なることに言及する価値があります。前者は単なる 5 秒のインストゥルメンタル クリップで、歌詞がなく、音質が限られており、ウェアハウスはアーカイブされ、維持されなくなっています。現在の Google Flow Music は、Google が自社開発した最先端のモデルで動作します。

  • Google Flow Music はクレジット サブスクリプション システムを使用しています。無料ファイルには、コンテンツの収益化に直接使用できる限定的なクレジット ポイントと商用ライセンスが提供されます。年払いの場合、有料プランの方が費用対効果が高くなります。Starter では月額約 6 ドル (月々の支払いは $7.99)、月額 3,000 クレジット、約 600 回生成されます。さらに、年間支払いは月約 18 ドル (月々の支払いは 24.99 ドル)、月あたり 10,000 クレジットです。メンバーの年間支払いは月額約 48 ドル (月額支払いは 64 ドル)、月額 30,000 クレジット、最大 16 の同時チャネルです。 Google AI Plus/Pro/Ultra の加入者は、それぞれ対応するレベルの Flow Music クレジットを受け取ります。 iOS アプリは 2026 年 5 月に利用可能になる予定ですが、Android はまだ開発中です。 2025 年初頭のパブリック ベータ段階で、riffusion.com は、新規ユーザーを迅速に獲得するために、「無料、無制限の生成、ログイン不要、ウォーターマークなし」という非常に寛大な戦略を採用しました。 Google に吸収された後、Google はより抑制されたクレジット ポイント モデルに切り替えましたが、無料のファイルは依然として商用権を保持しており、独立したクリエイターにとっては非常に優しいものとなっています。

  • 実際に体験した人は大体その「解放感」を認めます。 Tom's Guide の著者は、かつてこれを使用して 30 分で 7 曲のプレイリストを作成しました。アンリミテッド世代については、ポイントに縛られず、大胆に試行錯誤でき、クリエイティブの自由度が高く、コストもゼロであることを称賛した。彼はまた、完成した作品はスノほど洗練されておらず、ボーカルの良し悪しがあり、即発の言葉が常に正確に実行されるとは限らなかったことも認めた。 Toolify の評価はより技術的なものです。音質と歌詞の自然さ(機械臭の軽減)の点で優れていると考えられます。最大約4分までの完全な楽曲に対応します。 Suno V4と比較して、ボーカルには不自然な「シマー」メタル感が少なくなります。初心者や実験的な作品向けのレビューでは、「品質のプレッシャーなしに自由な探索を奨励する」楽園として、Suno の無料版と並んでランク付けされています。

  • Billboard や Music Business Worldwide などの権威あるメディアは、Google によるProducerAI の買収を AI 音楽トラックにおける重要なステップとみなしています。グーグルはスロットマシンを「スロットマシン」ではなく「クリエイティブなコラボレーター」と位置付けている――エリアス・ロマン氏は、即興の言葉を入れてスロットマシンを振るだけでは良い音楽は生まれないと強調した。 「時間をかけて磨き続ける」ためにProducerAIは生まれました。このため、Suno や Udio などの「一世代限り」の製品とは異なります。同じ分野で、Suno は規模と収益でリードしています。 2025年11月に2億5,000万米ドルのシリーズCラウンドを完了し、評価額は24億5,000万米ドル、年間収益は約2億米ドルとなった。 Udio、StabilityのStable Audio、ACE-Stepなども参加しています。

  • トレーニング データの透明性は避けられない問題です。 2025 年初頭に新バージョンがリリースされたとき、あるユーザーが CTO の Hayk Martiros にモデル トレーニング データのソースについて公的に質問しましたが、彼は返答しませんでした。 LANDR の AI 音楽専門家ダニエル・ローリング氏は、ProducerAI は認可された音楽でトレーニングされていないのではないかと推測しました。 Googleに吸収された後、Lyria 3の訓練データは詳細に公開されていません。 GoogleはYouTubeの音楽を使用しているとだけ述べ、Googleは「利用規約、パートナーシップ契約、適用法に従ってそれを使用する権利がある」とし、著作権とパートナーシップ契約については慎重であるべきだと強調した。 これは業界全体で著作権に対する高い圧力がかかっていることを反映しており、RIAAは著作権侵害でSunoとUdioを告訴した。スノはワーナーと和解し、ライセンス協力に至ったものの、依然としてソニー、ユニバーサル、欧州の著作権団体からの訴訟に直面している。アーティストの代表者グループも「スノにノーと言え」公開書簡を発行し、正当なアーティストの印税プールが希薄化していると非難した。一方、classic.riffusion.com は 2026 年 2 月 19 日にサイトを閉鎖し、生成された古いコンテンツ、セッション、モデルはすべてアクセスできなくなりました。ユーザーは期限までに作品をダウンロードする必要があり、古いユーザーからの反発を引き起こした。純粋主義者のために、Riffusion のオープンソース バージョンもアーカイブされてお​​り、廃止されました。クリップが短く、音質が限られており、歌詞がないため、長い間専用のオーディオ モデルに後れをとっていました。

  • これは、独立したミュージシャンがデモや簡単なインスピレーションのキャプチャを作成するのに適しており、コンテンツ クリエーターや広告会社が市販のカスタマイズされたサウンドトラックを作成するのに、開発者が Vibe コードと Lyria 3 API を介してブラウザ側のオーディオ プラグインを構築するのに適しています。完全オリジナルサウンドを求めている方やAI生成に抵抗のある方には合わないかもしれません。トレーニングの倫理を重視する場合は、完全に自社開発された音楽ライブラリと最もクリーンな著作権を備えた Soundraw のようなツールを優先できます。より「完成度」のある曲を求めるだけなら、通常はスノの磨き度の方が優れています。

  • Riffusion が「オープンソースのおもちゃ」から「Google の戦略的資産」への移行を完了するまでに 3 年以上かかりました。その真の価値は特定のモデルにあるのではなく、会話作成パラダイムと Google のフルスタック マルチモーダル機能 (Lyria オーディオ、Veo ビデオ、Gemini ダイアログ、Nano Banana カバー) の統合にあります。これはクリエイターにとっては障壁の低いツールであり、レコーディング スタジオのミュージシャンやプロデューサーにとっては潜在的な代替脅威です。SynthID ウォーターマークは、Google が「起源への追跡」がますます重要になることを理解していることを示しています。

ユーザーレビュー

  • 头像
    lv924bbd
    被 Google 收了之后音质明显上了一个台阶,Lyria 3 Pro 出来的歌已经能直接当短视频 BGM 用了,省了我找曲库的时间。

  • 头像
    JWhite
    从 Riffusion 到 ProducerAI 再到 Google Flow Music,三年换三个名字,吃瓜群众都跟不上了,但每次跃迁产品都变强,认了。只是希望 Google 别哪天又砍产品线,经典站那次教训还在。

  • 头像
    goldenbutterfly254
    训练数据到底用的啥一直没说清,CTO 之前被问到也不回,这点让我有点犹豫要不要拿它做正经发行。还是先用 Soundraw 那种版权干净的兜底,毕竟客户项目惹上版权纠纷可不是闹着玩的。

  • 头像
    Patrick.Nelson
    当年玩的就是它开源版,5 秒一段的 loop 现在看挺粗糙,但思路真超前,把 Stable Diffusion 搬到音频上这个点子到现在都新鲜。

  • 头像
    CHoward168695
    和 Suno 比,它的对话式编辑是真方便。我说「副歌鼓点再重一点」,它就只改那段,不用整首重生成。这种来回打磨的感觉才像在创作,不是摇老虎机。

  • 头像
    TBarnes_77
    人声还是偶尔抽风,有一版主歌好好的,到桥段突然发虚,重试两次才好。期待 Google 后续把声码器再打磨下。

  • 头像
    Vincent.ScottK
    歌词自然度比早期 AI 音乐强太多,不像某些工具满嘴「在星空下我们飞翔」的塑料句,它写的词居然有点人味了,还能顺着剧情改词不改旋律,做叙事向的歌特别顺手。

  • 头像
    BRfra
    做广告配乐的,需求方要定制中文台词 jingle,一次出三条不同风格,客户挑着用,交付快了一倍,这钱花得值。不过遇到特别刁钻的品牌调性,还是得自己进 DAW 再修一轮,当不了完全甩手。

  • 头像
    JohnWilliams
    免费档给商用权这点太香了,我做口播视频直接拿来当背景音乐,不用担心 YouTube 版权申诉,SynthID 水印反而让我更安心。

  • 头像
    JLong_2023
    Stem 分离挺实用,人声扒出来丢进 Ableton 自己混,等于拿它当灵感起点而不是终点,workflow 顺多了。对我这种半吊子制作人,它最大的价值不是替我写完歌,而是帮我把脑子里的模糊想法快速变成能改的素材。

  • 头像
    Victoria.TorresZ
    独立音乐人狂喜,写歌 demo 从一下午压缩到十分钟,拿给乐队排练直接能听个大概,沟通成本骤降。以前脑子里有旋律得赶紧摸吉他录下来,现在哼一段描述就出成品,灵感的衰减少了一大截,对我这种记谱苦手简直救命。

  • 头像
    Virginia987
    Spaces 那个 vibe-code 造乐器太上头了,我用一句话搓了个带磁带饱和的暖色 synth,还能分享给别人弹,这功能别家真没有,等于把合成器开发也 democratize 了。

  • 头像
    Gary.Lewis_7
    免费档信用点不太经用,天天生成的话两三天就见底,认真玩还是得开 Starter,一个月六刀倒也不贵,算下来单次成本比买曲库授权低太多了。

  • 头像
    Sophia_Coleman_2022
    老用户一枚,2026 年 2 月关 classic 站那次确实肉疼,之前存的 demo 全没了,还好提前下载了一部分。新平台强是强,但那种「我的作品说没就没」的失控感,让我对把创作全押在云端这件事重新掂量了一遍。

  • 头像
    DonnaGonzalez520
    Veo 生成的音乐视频有点 AI 味,一眼假,但当社媒铺垫素材够了,总比我自己剪空镜强。