Stable Diffusion

開源AI影象生成模型,透過文字描述生成高質量影象

深度報告

  • Stable Diffusion 是由 Stability AI 公司開發的開源AI影象生成模型,於2022年釋出。該模型基於潛在擴散模型(Latent Diffusion Models)技術,能夠透過文字描述生成高質量影象。作為開源專案,Stable Diffusion 提供免費使用的社群許可證,支援消費級顯示卡本地部署,為 AI 創意工具的普及做出了重要貢獻。然而,該模型也面臨來自藝術家的版權爭議,其訓練資料使用藝術家作品的行為引發了廣泛討論。

  • Stability AI 是一家成立於2024年的英國開源人工智慧公司,總部位於倫敦。公司 CEO Emad Mostaque 在 AI 領域擁有豐富經驗。在 Stable Diffusion 專案中,核心程式碼實際由德國慕尼黑大學和紐約大學的研究人員編寫,Stability AI 為該專案提供了計算資源支援並進行了產品化運營。 公司已獲得超過 1.01 億美元的投資,投資方包括 Coatue Management、光速創投等知名機構。Stability AI 的合作伙伴包括 EA Games、華納音樂、WPP、環球音樂、HubSpot 等國際知名企業。公司於 2026年4月8日釋出了 Brand Studio 品牌工作室,進一步擴充套件了其產品線。

  • Stable Diffusion 的核心功能包括影象生成、影象編輯、影片生成和 3D 模型建立。該模型支援文生圖、圖生圖兩種主要工作流程,使用者可以透過輸入文字提示詞生成影象,也可以基於現有影象進行風格遷移或區域性重繪。 在實際使用中,Stable Diffusion 展現出了強大的影象生成能力,但在細節處理上仍存在不足。例如,手部、材質、邊緣關係的精細度有待提升,有時會出現手指數量不正確、材質表現不自然等問題。此外,模型對語義的理解雖然基本準確,但在元素佈局和語義一致性方面仍有改進空間。 該模型支援多種取樣方法和程式碼實現,提供了豐富的引數配置選項供高階使用者進行定製。使用者可以在本地部署使用,也可以透過 DreamStudio 雲平臺進行線上生成。

  • Stable Diffusion 附帶社群許可證,大多數使用者可以免費使用該模型進行非商業用途。對於商業使用,需要申請商業許可證或使用 Stability AI 提供的企業解決方案。 DreamStudio 是 Stability AI 官方提供的雲平臺,採用積分制收費模式,使用者需要購買積分進行影象生成。不同版本的模型和功能對應不同的積分消耗量,企業使用者可以透過 "Book a demo" 或 "Start your deployment" 聯絡銷售團隊獲取定製報價。 公司還提供 Platform API 服務,允許開發者將影象生成能力整合到自己的應用中。此外,Stability AI 還提供自託管許可,允許使用者在自有伺服器上部署模型,實現高階定製和資料控制。

  • 使用者對 Stable Diffusion 的評價呈現兩極分化。正面評價主要集中在以下幾個方面:開源免費降低了 AI 影象生成的門檻,支援本地部署保護了使用者隱私,提供高度定製化空間,活躍的社群生態提供了豐富的外掛和模型。 負面反饋包括:上手門檻相對較高,需要一定的技術基礎知識,預設配置的出圖質量不如 Midjourney 等競品,細節處理不夠精細,文件和教程的更新有時跟不上版本迭代。 從市場對比來看,2026年的 AI 影象生成領域競爭激烈,Midjourney V8、FLUX、DALL-E 4 等產品都在不斷進化,Stable Diffusion 面臨著來自各個方向的競爭壓力。

  • 業界普遍認為 Stable Diffusion 是開源 AI 影象生成領域的重要里程碑。知乎使用者將其形容為 "第一次覺得影象生成模型已經足夠強",但同時指出在精細度和專業商用場景下仍有提升空間。 從技術發展角度看,2026年的 AI 影象生成技術正在向更高解析度、更快生成速度、更好語義理解方向演進。上交大和 vivo 團隊的研究表明,透過簡單的技術改進可以讓擴散模型獲得全面提升,相關成果已在 CVPR 2026發表。 行業媒體認為,Stable Diffusion 的開源策略對 AI 創意工具的普及起到了重要推動作用,但也因此面臨了更多的商業化挑戰。

  • Stable Diffusion 面臨的最大爭議來自版權問題。2022年9月,大量藝術家發現 Stable Diffusion 的訓練資料集中包含了自己的作品,而這些作品被用於免費生成競爭性內容,引發了藝術家的集體抗議。有藝術家表示 "用我的作品砸我的飯碗",認為這嚴重損害了原創作者的權益。 此外,關於 Stable Diffusion 原始碼的歸屬問題也曾引發討論。有報道指出,讓 Stability AI 成名的 Stable Diffusion 核心程式碼實際來自於其他研究人員的工作,這一爭議曾被福布斯報道。 財務方面,Stability AI 作為一家初創公司,面臨著持續燒錢和商業化變現的壓力,公司未來的盈利能力仍存在不確定性。

  • Stable Diffusion 適合以下使用者群體:技術背景較強、熟悉程式設計和 AI 工具的使用者,追求高度定製化和隱私保護的使用者,希望在本地部署實現離線使用的使用者,對開源社群生態有依賴的開發者。 對於追求開箱即用、追求極致畫質的普通使用者,建議考慮 Midjourney、DALL-E 等閉源方案,它們在易用性和預設輸出質量方面更具優勢。 對於企業使用者,建議評估 Stability AI 的企業解決方案或 Brand Studio 服務,這些商業產品通常提供更穩定的技術支援和合規保障。

  • Stable Diffusion 作為開源 AI 影象生成的開創者之一,在技術普及和社群建設方面做出了重要貢獻。該模型降低了 AI 影象生成的門檻,為創意表達提供了更多可能性。然而,隨著市場競爭的加劇,Stable Diffusion 需要在輸出質量、易用性和商業模式上持續進化,以保持競爭優勢。對於不同需求的使用者,選擇應基於自身的技術能力、使用場景和預算進行權衡。

使用者評論

  • 頭像
    Jordan_VasquezZ
    用了兩年 SD 的感受就是,前期投入確實大,光顯示卡就花了五六千,裝環境又搭進去一整天,但一旦跑通之後就是完全不一樣的體驗了。現在批次出圖零成本,LoRA 自己訓練角色一致性,ControlNet 精準控制構圖,這些功能閉源工具根本給不了。唯一遺憾的是底模質量還是不如 Flux,得靠社群模型補。

  • 頭像
    Carol_Jenkins_6628
    之前一直用 MJ,每個月 $30 說實話不算貴但總覺得不值,後來一狠心買了塊 RTX 4070 開始搗鼓 SD,剛開始確實崩潰,什麼 checkpoint、LoRA、sampler、CFG scale 這些概念完全懵的,好在 B 站和 Reddit 教程夠多,啃了大半個月終於能穩定出圖了。現在回頭看,當初的投入都值了,關鍵是想怎麼改就怎麼改,不需要求人。

  • 頭像
    Christina_Ruiz_X
    SD 3.5 跟 SDXL 比起來進步挺明顯的,特別是文字渲染和複雜 prompt 的理解上,以前寫個「穿著紅色旗袍的女孩站在櫻花樹下,背景是模糊的東京塔,黃昏光,電影感」,SDXL 經常把元素搞混或漏掉,3.5 基本能全理解到。不過模型大了之後吃視訊記憶體也更兇了,12GB 都感覺有點勉強,想流暢跑還是得上 24GB。

  • 頭像
    smallwolf479
    折騰了三天終於把 ComfyUI 跑起來了,RTX 4060 出圖還行吧,就是前置準備太勸退了。

  • 頭像
    LDavis36987
    SD 最大的優點就是免費,但免費的前提是你得先有一塊好顯示卡,這就已經勸退大部分人了。

  • 頭像
    TEsul
    從 WebUI 切到 ComfyUI 花了我整整一個週末,但節點式工作流確實比點按鈕強太多了。

  • 頭像
    TheCeylanBeşerler_2024
    用 SDXL 配 DreamShaper 出圖效果已經可以媲美 MJ 了,關鍵是開源免費,商用也不怕被告。

  • 頭像
    BPerez_Plus
    ControlNet 真的是 SD 的靈魂外掛,一張骨架圖配幾行 prompt 就能精準控制構圖,MJ 根本做不到。

  • 頭像
    Dylan234
    Civitai 上 LoRA 模型多得看不完,從吉卜力風到賽博朋克應有盡有,這才是 SD 最大的護城河。

  • 頭像
    SeanCook
    inpainting + outpainting 用習慣了回不去別的工具,區域性修改比在 PS 裡摳圖快十倍。

  • 頭像
    DorisTorres_2023
    坦白講 SD 的學習曲線太陡了,sampler、CFG、step、denoising 這些引數夠新手研究一兩個月。

  • 頭像
    aNN473
    裝了一整天才跑通,中途各種依賴衝突,要不是因為有顯示卡早放棄了。

  • 頭像
    brownswan958
    最近把 ComfyUI 的生產管線搭起來了,一個工作流模板串聯了文生圖、高畫質放大、面部修復、背景替換四個步驟,按一下按鈕全自動跑完。以前在 PS 裡手動修一套圖至少半小時,現在一分多鐘搞定。SD 對技術型使用者來說確實是當前最強大的工具,但對只想點點滑鼠就出大片的人來說還是趁早用 MJ 吧。

  • 頭像
    康博
    r/StableDiffusion 五百多萬成員,啥問題都能搜到答案,這生態不是閉源工具能比的。

  • 頭像
    鄒萱欣
    最香的是零成本商用,接甲方專案直接用 SD 出圖,省了每個月給 MJ 交保護費。

  • 頭像
    尹靜
    Flux 質量確實比 SD 3.5 好,但社群模型和 LoRA 資源 SD 還是王者,兩者互補著用最舒服。

  • 頭像
    bApow
    SD 底模質量一般,但配上社群訓練的大模型如 Realistic Vision 或 DreamShaper 一下就起飛了。

  • 頭像
    Helen.Patel_Plus
    MJ 開箱即用確實香,但每個月 $10-$30 一年下來也不少,SD 一次性硬體投入長遠看更划算。

  • 頭像
    Ruth_NguyenQ
    說 SD 不好用的多半是沒耐心折騰的,這東西確實不像 MJ 那樣開箱即用,但你要想啊,每個月給 MJ 交保護費不說,生成的圖還不能商用,想微調一下構圖根本沒門兒。SD 就不一樣了,本地部署零成本無限生成,ControlNet + LoRA 組合拳一出,想做什麼風格都行。唯一的問題就是社群模型太多太雜,篩選起來有點累。

  • 頭像
    Abigail_RossSr
    做企業專案最看重資料不出本機,SD 本地部署離線可用,光這一條就秒殺所有云端方案了。

  • 頭像
    Linda.Torres520
    斷網也能跑圖,上次出差在飛機上連 Wi-Fi 都沒有,就靠 SD 整了一組產品素材。

  • 頭像
    orangegorilla120
    秋葉大佬的整合包真的是中文使用者的福音,解壓即用一鍵啟動,小白也能玩 SD 了。

  • 頭像
    rjyztggo_dev
    LiblibAI 上國內創作者分享的工作流直接複製到 ComfyUI 就能跑,比從零搭省太多事了。

  • 頭像
    blPAR
    RTX 4090 上 SD 3.5 出 1024x1024 只需要 3-4 秒,但換到 1660 直接卡成 PPT,顯示卡差距太大了。

  • 頭像
    Joyce_Carter
    8GB 視訊記憶體跑 SDXL 非常勉強,換了 4070 Ti 12GB 後才真正體會到什麼叫絲滑。

  • 頭像
    Danielle958
    WebUI 從 2024 年 7 月最後一次更新後就沒動靜了,現在都在用 ComfyUI,節點式工作流才是未來。

  • 頭像
    xEeviMakela
    說實話 ComfyUI 對新手太不友好了,但一旦上手建好自己的工作流模板,效率是 WebUI 的好幾倍。

  • 頭像
    Matthew_Barnes_7
    電商產品圖批次生成用 SD 的 inpainting + ControlNet 流水線,一套自動化流程下來一天出幾百張沒問題。

  • 頭像
    jw2n3
    很多人說 SD 的安裝門檻高,我覺得其實要看怎麼裝。秋葉的整合包一鍵解壓就用了,ComfyUI 也有官方桌面版,根本不需要命令列。但如果你想自己調參、換模型、裝外掛,那就確實需要懂點技術了。而且社群模型質量參差不齊是非常現實的問題,Civitai 上下載量高的 checkpoint 基本靠譜,小眾的就看運氣了。

  • 頭像
    Carolyn_WalkerII612
    做遊戲素材的,SD + LoRA 保持角色一致性簡直絕了,比手繪快幾十倍而且風格統一。