Riffusion
从 2022 年开源频谱图扩散模型到 Google Flow Music,Riffusion 是对话式 AI 音乐创作平台,用自然语言即可生成带人声与编曲的完整歌曲
深度报告
-
Riffusion 是 AI 音乐生成领域的老兵,也是目前身份变化最戏剧化的一家。它从 2022 年底一个把「图像扩散」用到音频上的开源玩具起步,2023 年拿到 400 万美元种子轮,2025 年 7 月更名为 ProducerAI 并冲到百万用户,2026 年 2 月被 Google 整体收购,2026 年 4 月再以 Google Flow Music 的身份重生。今天你在 riffusion.com 看到的产品,本质上已经是 Google DeepMind 在 Google Labs 旗下的对话式 AI 音乐创作平台,由 Lyria 3、Gemini、Veo 和 Nano Banana 共同驱动。
-
Riffusion 最初是 Seth Forsgren 和 Hayk Martiros 的业余项目,2022 年 12 月 15 日开源。他们的巧思在于:用微调过的 Stable Diffusion v1.5 在「频谱图」上做扩散,把文本提示变成频谱图图像,再用逆傅里叶变换转回音频。时间就是图像的横轴,于是二维图像模型也能建模音频结构。原始模型按 MIT 协议开放,但只生成约 5 秒的器乐片段、没有歌词,音质也有限。 病毒式走红之后,两人把项目商业化。2023 年 10 月,Riffusion 完成 400 万美元种子轮,由 Greycroft 领投,South Park Commons 和 Sky9 跟投,电子音乐组合 The Chainsmokers 出任顾问。此后产品几经迭代:2025 年 1 月推出免费无限使用的公测网页版,2025 年 7 月正式更名为 ProducerAI,换上自研的 FUZZ-2.0 模型并引入对话式创作界面,在被 Google 收购前已突破一百万用户。 2026 年 2 月 24 日,Google 通过 Google Labs 产品管理总监 Elias Roman 的博客宣布收购 ProducerAI,整个团队并入 Google Labs 与 Google DeepMind。这距离 Google 发布最新音乐模型 Lyria 3 仅一周。2026 年 4 月,产品再次更名,以 Google Flow Music 面世,底层换成 Lyria 3 Pro;2026 年 5 月上线 iOS 应用,并在 Google I/O 加入细粒度分段编辑。Producer.ai 现已重定向到 flowmusic.app,但外界仍普遍以 Riffusion 或 Producer AI 称呼它。
-
当前产品是「对话式」的:用户用自然语言和一个由 Gemini 驱动的 Producer agent 交流,像在录音棚里跟制作人说话一样——「把第二段主歌的贝斯做得更狠一点」「把歌词翻成西班牙语但保留旋律」。它支持文本、图像和音频三种条件输入,能一次生成带人声、编曲和歌词的完整歌曲。 核心模型 Lyria 3 Pro 采用分层注意力机制,最长可生成 3 分钟、44.1kHz 立体声的完整歌曲,并能让第一段主歌的旋律动机在桥段和尾奏里重现、演化。围绕这首歌,平台提供一整套编辑能力:Remix 混音、Extend 续写、Stem 分离(拆出人声、鼓、贝斯、旋律后在传统 DAW 里精修)、Replace 与分段编辑(只改不满意的那一段而不动全曲)、AI 翻唱(上传一段音频,平台围绕它重新编排音乐)。 更特别的两条是 Spaces 与音乐视频。Spaces 让你用自然语言造出全新的乐器、合成器和效果器,平台称之为「vibe-code」,无需写代码就能生成可弹奏、可分享的浏览器端音频工具,目前没有竞品提供类似能力。音乐视频则由 Veo 或 Gemini Omni Flash 根据曲目叙事生成配套短视频。所有输出都嵌入 Google 的 SynthID 不可见水印,可在 synthid.google.com 验证其 AI 来源。 值得一提的是,早期 riffusion.com 的开源版本与今天的产品完全是两回事:前者只是 5 秒器乐片段、无歌词、音质有限且仓库已归档不再维护;今日的 Google Flow Music 跑的是 Google 自研前沿模型。
-
Google Flow Music 采用信用点(credit)订阅制。免费档提供有限信用点和商用授权,可以直接用于变现内容。付费档按年付更划算:Starter 年付约 6 美元/月(月付 7.99 美元),每月 3000 信用、约 600 次生成;Plus 年付约 18 美元/月(月付 24.99 美元),每月 1 万信用;Member 年付约 48 美元/月(月付 64 美元),每月 3 万信用、最多 16 路并发。Google AI Plus / Pro / Ultra 订阅用户会分别获得对应档位的 Flow Music 信用。iOS 应用已于 2026 年 5 月上线,Android 仍在开发中。 在 2025 年初的公测阶段,riffusion.com 曾以「免费、无限生成、无需登录、无水印」的极慷慨策略快速拉新;被 Google 收编后转向更克制的信用点模型,但免费档仍保留商用权,对独立创作者相当友好。
-
实际体验者普遍认可它的「自由感」。Tom's Guide 的作者曾用它在半小时内做出一张 7 首歌的播放列表,盛赞无限生成让人敢于反复试错、不被点数束缚,创意自由度高且零成本;他也坦言成品打磨度不及 Suno,人声时好时坏,提示词也不总被精确执行。Toolify 的评测更偏向技术维度,认为它在音频质量、歌词自然度(减少机器味)上表现突出,支持最长约 4 分钟完整歌曲,人声相比 Suno V4 减少了不自然的「Shimmer」金属感。面向新手和实验性创作的评测则把它和 Suno 免费档并列,视为「鼓励自由探索、没有质量压力」的乐园。
-
Billboard 与 Music Business Worldwide 等权威媒体把 Google 收购 ProducerAI 视作 AI 音乐赛道的关键一步。Google 给它的定位是「创作协作者」而非「老虎机」——Elias Roman 强调,好的音乐不是塞个提示词、摇老虎机就能出来的,ProducerAI 正是为「随着时间展开的来回打磨」而生。这让它和 Suno、Udio 等「一次性生成」的产品形成差异。在同一赛道里,Suno 体量和收入领先,2025 年 11 月完成 2.5 亿美元 C 轮、估值 24.5 亿美元、年营收约 2 亿美元;与之并列的还有 Udio、Stability 的 Stable Audio、ACE-Step 等。
-
训练数据的透明度是绕不开的疑问。在 2025 年初新版本发布时,有用户公开询问 CTO Hayk Martiros 模型训练数据来源,他未予回应;LANDR 的 AI 音乐专家 Daniel Rowling 据此推测 ProducerAI 并未在获授权音乐上训练。被 Google 收编后,Lyria 3 的训练数据也未被详细披露,Google 仅表示用的是 YouTube 与 Google「依服务条款、伙伴协议及适用法律有权使用」的音乐,并强调对版权与伙伴协议保持审慎。 这与整个行业的版权高压相呼应:RIAA 已起诉 Suno 与 Udio 侵权,Suno 虽与华纳和解并达成授权合作,仍面临索尼、环球及欧洲版权组织的诉讼;一众艺人代表还发表了「Say No to Suno」公开信,指责其稀释正版艺人版税池。另一方面,2026 年 2 月 19 日 classic.riffusion.com 关站,旧生成内容、会话与模型全部不可访问,用户被要求在截止日前下载作品,引发一批老用户反弹。对纯粹主义者而言,开源版 Riffusion 也已归档、实质停更,其短片段、有限音质、无歌词的局限让它早被专用音频模型甩在身后。
-
它适合独立音乐人做 Demo 与快速灵感捕捉、内容创作者和广告公司做可商用的定制配乐、开发者通过 Vibe-code 与 Lyria 3 API 搭建浏览器端音频插件。对追求完全原创音色、或对 AI 生成持保留态度的人,它未必合拍。若在意训练伦理,可优先看 Soundraw 这类全程自研曲库、版权最干净的工具;若只想要更「成品感」的歌,Suno 的打磨度通常更胜一筹。
-
Riffusion 用三年多完成从「开源玩具」到「Google 战略资产」的跃迁,其真正价值不在某一个模型,而在对话式创作范式与 Google 全栈多模态能力(Lyria 音频、Veo 视频、Gemini 对话、Nano Banana 封面)的整合。对创作者它是低门槛利器,对录音棚里的乐手与制作人则是潜在的替代威胁——而 SynthID 水印恰恰说明 Google 清楚「溯源」会变得越来越重要。
用户评论
-
lv924bbd—被 Google 收了之后音质明显上了一个台阶,Lyria 3 Pro 出来的歌已经能直接当短视频 BGM 用了,省了我找曲库的时间。 -
JWhite—从 Riffusion 到 ProducerAI 再到 Google Flow Music,三年换三个名字,吃瓜群众都跟不上了,但每次跃迁产品都变强,认了。只是希望 Google 别哪天又砍产品线,经典站那次教训还在。 -
goldenbutterfly254—训练数据到底用的啥一直没说清,CTO 之前被问到也不回,这点让我有点犹豫要不要拿它做正经发行。还是先用 Soundraw 那种版权干净的兜底,毕竟客户项目惹上版权纠纷可不是闹着玩的。 -
Patrick.Nelson—当年玩的就是它开源版,5 秒一段的 loop 现在看挺粗糙,但思路真超前,把 Stable Diffusion 搬到音频上这个点子到现在都新鲜。 -
CHoward168695—和 Suno 比,它的对话式编辑是真方便。我说「副歌鼓点再重一点」,它就只改那段,不用整首重生成。这种来回打磨的感觉才像在创作,不是摇老虎机。 -
TBarnes_77—人声还是偶尔抽风,有一版主歌好好的,到桥段突然发虚,重试两次才好。期待 Google 后续把声码器再打磨下。 -
Vincent.ScottK—歌词自然度比早期 AI 音乐强太多,不像某些工具满嘴「在星空下我们飞翔」的塑料句,它写的词居然有点人味了,还能顺着剧情改词不改旋律,做叙事向的歌特别顺手。 -
BRfra—做广告配乐的,需求方要定制中文台词 jingle,一次出三条不同风格,客户挑着用,交付快了一倍,这钱花得值。不过遇到特别刁钻的品牌调性,还是得自己进 DAW 再修一轮,当不了完全甩手。 -
JohnWilliams—免费档给商用权这点太香了,我做口播视频直接拿来当背景音乐,不用担心 YouTube 版权申诉,SynthID 水印反而让我更安心。 -
JLong_2023—Stem 分离挺实用,人声扒出来丢进 Ableton 自己混,等于拿它当灵感起点而不是终点,workflow 顺多了。对我这种半吊子制作人,它最大的价值不是替我写完歌,而是帮我把脑子里的模糊想法快速变成能改的素材。 -
Victoria.TorresZ—独立音乐人狂喜,写歌 demo 从一下午压缩到十分钟,拿给乐队排练直接能听个大概,沟通成本骤降。以前脑子里有旋律得赶紧摸吉他录下来,现在哼一段描述就出成品,灵感的衰减少了一大截,对我这种记谱苦手简直救命。 -
Virginia987—Spaces 那个 vibe-code 造乐器太上头了,我用一句话搓了个带磁带饱和的暖色 synth,还能分享给别人弹,这功能别家真没有,等于把合成器开发也 democratize 了。 -
Gary.Lewis_7—免费档信用点不太经用,天天生成的话两三天就见底,认真玩还是得开 Starter,一个月六刀倒也不贵,算下来单次成本比买曲库授权低太多了。 -
Sophia_Coleman_2022—老用户一枚,2026 年 2 月关 classic 站那次确实肉疼,之前存的 demo 全没了,还好提前下载了一部分。新平台强是强,但那种「我的作品说没就没」的失控感,让我对把创作全押在云端这件事重新掂量了一遍。 -
DonnaGonzalez520—Veo 生成的音乐视频有点 AI 味,一眼假,但当社媒铺垫素材够了,总比我自己剪空镜强。