Stable Diffusion

开源AI图像生成模型,通过文本描述生成高质量图像

深度报告

  • Stable Diffusion 是由 Stability AI 公司开发的开源AI图像生成模型,于2022年发布。该模型基于潜在扩散模型(Latent Diffusion Models)技术,能够通过文本描述生成高质量图像。作为开源项目,Stable Diffusion 提供免费使用的社区许可证,支持消费级显卡本地部署,为 AI 创意工具的普及做出了重要贡献。然而,该模型也面临来自艺术家的版权争议,其训练数据使用艺术家作品的行为引发了广泛讨论。

  • Stability AI 是一家成立于2024年的英国开源人工智能公司,总部位于伦敦。公司 CEO Emad Mostaque 在 AI 领域拥有丰富经验。在 Stable Diffusion 项目中,核心代码实际由德国慕尼黑大学和纽约大学的研究人员编写,Stability AI 为该项目提供了计算资源支持并进行了产品化运营。 公司已获得超过 1.01 亿美元的投资,投资方包括 Coatue Management、光速创投等知名机构。Stability AI 的合作伙伴包括 EA Games、华纳音乐、WPP、环球音乐、HubSpot 等国际知名企业。公司于 2026年4月8日发布了 Brand Studio 品牌工作室,进一步扩展了其产品线。

  • Stable Diffusion 的核心功能包括图像生成、图像编辑、视频生成和 3D 模型创建。该模型支持文生图、图生图两种主要工作流程,用户可以通过输入文本提示词生成图像,也可以基于现有图像进行风格迁移或局部重绘。 在实际使用中,Stable Diffusion 展现出了强大的图像生成能力,但在细节处理上仍存在不足。例如,手部、材质、边缘关系的精细度有待提升,有时会出现手指数量不正确、材质表现不自然等问题。此外,模型对语义的理解虽然基本准确,但在元素布局和语义一致性方面仍有改进空间。 该模型支持多种采样方法和代码实现,提供了丰富的参数配置选项供高级用户进行定制。用户可以在本地部署使用,也可以通过 DreamStudio 云平台进行在线生成。

  • Stable Diffusion 附带社区许可证,大多数用户可以免费使用该模型进行非商业用途。对于商业使用,需要申请商业许可证或使用 Stability AI 提供的企业解决方案。 DreamStudio 是 Stability AI 官方提供的云平台,采用积分制收费模式,用户需要购买积分进行图像生成。不同版本的模型和功能对应不同的积分消耗量,企业用户可以通过 "Book a demo" 或 "Start your deployment" 联系销售团队获取定制报价。 公司还提供 Platform API 服务,允许开发者将图像生成能力集成到自己的应用中。此外,Stability AI 还提供自托管许可,允许用户在自有服务器上部署模型,实现高级定制和数据控制。

  • 用户对 Stable Diffusion 的评价呈现两极分化。正面评价主要集中在以下几个方面:开源免费降低了 AI 图像生成的门槛,支持本地部署保护了用户隐私,提供高度定制化空间,活跃的社区生态提供了丰富的插件和模型。 负面反馈包括:上手门槛相对较高,需要一定的技术基础知识,默认配置的出图质量不如 Midjourney 等竞品,细节处理不够精细,文档和教程的更新有时跟不上版本迭代。 从市场对比来看,2026年的 AI 图像生成领域竞争激烈,Midjourney V8、FLUX、DALL-E 4 等产品都在不断进化,Stable Diffusion 面临着来自各个方向的竞争压力。

  • 业界普遍认为 Stable Diffusion 是开源 AI 图像生成领域的重要里程碑。知乎用户将其形容为 "第一次觉得图像生成模型已经足够强",但同时指出在精细度和专业商用场景下仍有提升空间。 从技术发展角度看,2026年的 AI 图像生成技术正在向更高分辨率、更快生成速度、更好语义理解方向演进。上交大和 vivo 团队的研究表明,通过简单的技术改进可以让扩散模型获得全面提升,相关成果已在 CVPR 2026发表。 行业媒体认为,Stable Diffusion 的开源策略对 AI 创意工具的普及起到了重要推动作用,但也因此面临了更多的商业化挑战。

  • Stable Diffusion 面临的最大争议来自版权问题。2022年9月,大量艺术家发现 Stable Diffusion 的训练数据集中包含了自己的作品,而这些作品被用于免费生成竞争性内容,引发了艺术家的集体抗议。有艺术家表示 "用我的作品砸我的饭碗",认为这严重损害了原创作者的权益。 此外,关于 Stable Diffusion 源代码的归属问题也曾引发讨论。有报道指出,让 Stability AI 成名的 Stable Diffusion 核心代码实际来自于其他研究人员的工作,这一争议曾被福布斯报道。 财务方面,Stability AI 作为一家初创公司,面临着持续烧钱和商业化变现的压力,公司未来的盈利能力仍存在不确定性。

  • Stable Diffusion 适合以下用户群体:技术背景较强、熟悉编程和 AI 工具的用户,追求高度定制化和隐私保护的用户,希望在本地部署实现离线使用的用户,对开源社区生态有依赖的开发者。 对于追求开箱即用、追求极致画质的普通用户,建议考虑 Midjourney、DALL-E 等闭源方案,它们在易用性和默认输出质量方面更具优势。 对于企业用户,建议评估 Stability AI 的企业解决方案或 Brand Studio 服务,这些商业产品通常提供更稳定的技术支持和合规保障。

  • Stable Diffusion 作为开源 AI 图像生成的开创者之一,在技术普及和社区建设方面做出了重要贡献。该模型降低了 AI 图像生成的门槛,为创意表达提供了更多可能性。然而,随着市场竞争的加剧,Stable Diffusion 需要在输出质量、易用性和商业模式上持续进化,以保持竞争优势。对于不同需求的用户,选择应基于自身的技术能力、使用场景和预算进行权衡。

用户评论

  • 头像
    Jordan_VasquezZ
    用了两年 SD 的感受就是,前期投入确实大,光显卡就花了五六千,装环境又搭进去一整天,但一旦跑通之后就是完全不一样的体验了。现在批量出图零成本,LoRA 自己训练角色一致性,ControlNet 精准控制构图,这些功能闭源工具根本给不了。唯一遗憾的是底模质量还是不如 Flux,得靠社区模型补。

  • 头像
    Carol_Jenkins_6628
    之前一直用 MJ,每个月 $30 说实话不算贵但总觉得不值,后来一狠心买了块 RTX 4070 开始捣鼓 SD,刚开始确实崩溃,什么 checkpoint、LoRA、sampler、CFG scale 这些概念完全懵的,好在 B 站和 Reddit 教程够多,啃了大半个月终于能稳定出图了。现在回头看,当初的投入都值了,关键是想怎么改就怎么改,不需要求人。

  • 头像
    Christina_Ruiz_X
    SD 3.5 跟 SDXL 比起来进步挺明显的,特别是文字渲染和复杂 prompt 的理解上,以前写个「穿着红色旗袍的女孩站在樱花树下,背景是模糊的东京塔,黄昏光,电影感」,SDXL 经常把元素搞混或漏掉,3.5 基本能全理解到。不过模型大了之后吃显存也更凶了,12GB 都感觉有点勉强,想流畅跑还是得上 24GB。

  • 头像
    smallwolf479
    折腾了三天终于把 ComfyUI 跑起来了,RTX 4060 出图还行吧,就是前置准备太劝退了。

  • 头像
    LDavis36987
    SD 最大的优点就是免费,但免费的前提是你得先有一块好显卡,这就已经劝退大部分人了。

  • 头像
    TEsul
    从 WebUI 切到 ComfyUI 花了我整整一个周末,但节点式工作流确实比点按钮强太多了。

  • 头像
    TheCeylanBeşerler_2024
    用 SDXL 配 DreamShaper 出图效果已经可以媲美 MJ 了,关键是开源免费,商用也不怕被告。

  • 头像
    BPerez_Plus
    ControlNet 真的是 SD 的灵魂插件,一张骨架图配几行 prompt 就能精准控制构图,MJ 根本做不到。

  • 头像
    Dylan234
    Civitai 上 LoRA 模型多得看不完,从吉卜力风到赛博朋克应有尽有,这才是 SD 最大的护城河。

  • 头像
    SeanCook
    inpainting + outpainting 用习惯了回不去别的工具,局部修改比在 PS 里抠图快十倍。

  • 头像
    DorisTorres_2023
    坦白讲 SD 的学习曲线太陡了,sampler、CFG、step、denoising 这些参数够新手研究一两个月。

  • 头像
    aNN473
    装了一整天才跑通,中途各种依赖冲突,要不是因为有显卡早放弃了。

  • 头像
    brownswan958
    最近把 ComfyUI 的生产管线搭起来了,一个工作流模板串联了文生图、高清放大、面部修复、背景替换四个步骤,按一下按钮全自动跑完。以前在 PS 里手动修一套图至少半小时,现在一分多钟搞定。SD 对技术型用户来说确实是当前最强大的工具,但对只想点点鼠标就出大片的人来说还是趁早用 MJ 吧。

  • 头像
    康博
    r/StableDiffusion 五百多万成员,啥问题都能搜到答案,这生态不是闭源工具能比的。

  • 头像
    邹萱欣
    最香的是零成本商用,接甲方项目直接用 SD 出图,省了每个月给 MJ 交保护费。

  • 头像
    尹静
    Flux 质量确实比 SD 3.5 好,但社区模型和 LoRA 资源 SD 还是王者,两者互补着用最舒服。

  • 头像
    bApow
    SD 底模质量一般,但配上社区训练的大模型如 Realistic Vision 或 DreamShaper 一下就起飞了。

  • 头像
    Helen.Patel_Plus
    MJ 开箱即用确实香,但每个月 $10-$30 一年下来也不少,SD 一次性硬件投入长远看更划算。

  • 头像
    Ruth_NguyenQ
    说 SD 不好用的多半是没耐心折腾的,这东西确实不像 MJ 那样开箱即用,但你要想啊,每个月给 MJ 交保护费不说,生成的图还不能商用,想微调一下构图根本没门儿。SD 就不一样了,本地部署零成本无限生成,ControlNet + LoRA 组合拳一出,想做什么风格都行。唯一的问题就是社区模型太多太杂,筛选起来有点累。

  • 头像
    Abigail_RossSr
    做企业项目最看重数据不出本机,SD 本地部署离线可用,光这一条就秒杀所有云端方案了。

  • 头像
    Linda.Torres520
    断网也能跑图,上次出差在飞机上连 Wi-Fi 都没有,就靠 SD 整了一组产品素材。

  • 头像
    orangegorilla120
    秋叶大佬的整合包真的是中文用户的福音,解压即用一键启动,小白也能玩 SD 了。

  • 头像
    rjyztggo_dev
    LiblibAI 上国内创作者分享的工作流直接复制到 ComfyUI 就能跑,比从零搭省太多事了。

  • 头像
    blPAR
    RTX 4090 上 SD 3.5 出 1024x1024 只需要 3-4 秒,但换到 1660 直接卡成 PPT,显卡差距太大了。

  • 头像
    Joyce_Carter
    8GB 显存跑 SDXL 非常勉强,换了 4070 Ti 12GB 后才真正体会到什么叫丝滑。

  • 头像
    Danielle958
    WebUI 从 2024 年 7 月最后一次更新后就没动静了,现在都在用 ComfyUI,节点式工作流才是未来。

  • 头像
    xEeviMakela
    说实话 ComfyUI 对新手太不友好了,但一旦上手建好自己的工作流模板,效率是 WebUI 的好几倍。

  • 头像
    Matthew_Barnes_7
    电商产品图批量生成用 SD 的 inpainting + ControlNet 流水线,一套自动化流程下来一天出几百张没问题。

  • 头像
    jw2n3
    很多人说 SD 的安装门槛高,我觉得其实要看怎么装。秋叶的整合包一键解压就用了,ComfyUI 也有官方桌面版,根本不需要命令行。但如果你想自己调参、换模型、装插件,那就确实需要懂点技术了。而且社区模型质量参差不齐是非常现实的问题,Civitai 上下载量高的 checkpoint 基本靠谱,小众的就看运气了。

  • 头像
    Carolyn_WalkerII612
    做游戏素材的,SD + LoRA 保持角色一致性简直绝了,比手绘快几十倍而且风格统一。