Kyutai Pocket-TTS

1 億引數的開源端側語音合成模型,CPU 實時執行、5 秒音訊即可克隆任意聲音

深度報告

  • Pocket-TTS 是法國開源 AI 實驗室 Kyutai 於 2026 年 1 月釋出的輕量級文字轉語音(TTS)模型,引數僅 1 億、可在 CPU 上實時執行,並具備零樣本聲音克隆能力。它填補了「大模型音質」與「小模型輕量」之間的空白:既能像 10 倍體量的模型那樣克隆任意聲音,又不需要 GPU。2026 年 5 月,Kyutai 又為其補齊了英、法、德、西、葡、意六種語言。

  • Kyutai 是一家位於巴黎、以開放科學(open science)為信條的 AI 研究實驗室,目標是構建並 democratize 通用人工智慧。實驗室由法國電信巨頭 Iliad(Free 母公司)創始人 Xavier Niel 等人出資支援,走完全開源路線,此前已推出實時語音對話系統 Moshi、流式 TTS 模型 Kyutai TTS 1.6B、低延遲流式語音編解碼器 Mimi 等。 Pocket-TTS 脫胎於 Kyutai 語音研究,核心論文依據是 2025 年發表的「Continuous Audio Language Models(CALM)」框架。專案作者包括 Manu Orsini、Simon Rouard、Gabriel De Marmiesse、Václav Volhejn、Neil Zeghidour、Alexandre Défossez 等人,程式碼與權重以 MIT 許可證在 GitHub 開源,模型卡託管於 Hugging Face。訓練資料全部為公開英文語料,累計約 8.8 萬小時音訊(AMI、EARNINGS22、GIGASpeech、SPGISpeech、TED-LIUM、VoxPopuli、LibriHeavy、Emilia 等),刻意只用公開資料以保證可復現性。

  • Pocket-TTS 的生成模型(因果 Transformer + MLP 頭)僅 9000 萬引數,編解碼器解碼端 1000 萬,合計 1 億;聲音編碼端另有 1800 萬引數,僅在編碼參考音色時呼叫一次。它最大的工程突破是徹底拋棄了傳統 TTS 的離散音訊 token,改為直接預測連續隱變數(continuous latents),配合 Lagrangian Self-Distillation(LSD)實現單步取樣,從而把模型壓到極小而不損失質量。 聲音克隆是它最亮眼的能力:只需約 5 秒參考音訊,即可零樣本復刻音色、情緒、口音、語速乃至混響與麥克風聲學條件,全程無需微調或標註說話人資料。使用者可使用內建音色庫(如 Alba、Marius、Javert、Jean、Fantine、Cosette、Eponine、Azelma 等,多為《悲慘世界》角色名),也可上傳自己的音訊樣本。 部署極簡。安裝 uv 後一條命令即可起本地服務(`uvx pocket-tts serve`)或命令列生成(`uvx pocket-tts generate`);也支援 Python API(`from pocket_tts import TTSModel`)。官方維護的 pocket-tts-js 版本基於 WebAssembly/WebGPU,可在瀏覽器標籤頁內純客戶端執行,模型下載後全程不再呼叫伺服器。 速度表現突出。在 MacBook Air M4 上約 6 倍實時(6x real-time),首包延遲約 200 毫秒,僅佔用 2 個 CPU 核心;Intel Core Ultra 7 165H 與 Apple M3 上也明顯快於實時。在 Kyutai 的橫向測試中,F5-TTS(3.36 億)、Kyutai TTS 1.6B(7.5 億)、Chatterbox Turbo(3.5 億)均無法在 CPU 上實時執行,只有 Kokoro(8200 萬,但無聲音克隆)和 Pocket-TTS 能做到。

  • Pocket-TTS 完全免費、MIT 協議、可商用。它本身不賣訂閱、不收 API 費,靠開源社群與 Kyutai 的科研經費維持。對比之下,商業 TTS 標杆 ElevenLabs 最低檔約每月 22 美元起。Kyutai 的商業模式更像是「研究即產品」:透過開源模型建立生態與影響力,再由其首家衍生公司 Gradium 把語音研究轉化為可規模化的生產級系統。開發者若要在產品內嵌本地語音功能,幾乎零成本接入口袋模型即可。

  • 正面反饋集中在「門檻極低」與「本地可控」。不少使用者稱從空白終端到克隆出自己聲音不到十五分鐘,pip 安裝、一行命令即可生成,且全程在本地 CPU 完成,無需顯示卡、不上雲,隱私性天然佔優。社群(如 r/LocalLLaMA)將其與 Kokoro、Supertonic、Inflect-Nano 並列做英文 TTS 基準,認可它是唯一能「在 CPU 上克隆聲音、無需 GPU」的開源方案。 負面與侷限同樣明確。其一,音質仍不如大引數模型:客觀指標上 Pocket-TTS 詞錯率(WER 1.84)與 F5-TTS、Kyutai TTS 1.6B 接近,但音訊質量 ELO(2016)低於 Chatterbox Turbo(2055)等;追求播音級音質時它仍是「能用」而非「驚豔」。其二,克隆效果高度依賴參考音訊質量,髒樣本會被如實復刻。其三,截至 2026 年 5 月官方僅支援英、法、德、西、葡、意六種語言,尚無中文、日文、韓文、阿拉伯語等,跨語言克隆時口音會跟隨源音色(如用法語音色念英文會帶魁北克或外來口音)。其四,社群生態尚在早期,遇到坑得多翻 GitHub Issues。

  • 行業普遍把 Pocket-TTS 視為「小模型補上聲音克隆」的關鍵一步。技術報告給出了硬核證據:在 Librispeech test-clean 上,它 WER 最低(1.84),音訊質量 ELO(2016)優於 ground truth 與 F5-TTS、DSM,說話人相似度 ELO(1898)與 ground truth 持平,卻只有對手幾十分之一的引數量。媒體評測認為它重新定義了「端側 TTS」的邊界——把原本需要 GPU 的克隆能力塞進了筆記本和手機。 與競品格局對照:Kokoro(8200 萬)更輕但音色固定、無克隆;Kyutai TTS 1.6B 音質更強但需 GPU;ElevenLabs 絕對音質與語種覆蓋領先,但收費且走雲 API。Pocket-TTS 的定位很清晰——做 agent 內嵌、本地常駐、隱私優先場景的務實之選。

  • Pocket-TTS 5 秒克隆、零門檻、純本地執行的特性,也把聲音偽造的門檻拉到了地板。xda-developers 的一篇親測文章直言,作者用普通 Ryzen CPU、無任何技術背景,靠問 LLM 拿到步驟,15 分鐘內就復刻出以假亂真的自己聲音,並擔憂銀行電話聲紋驗證體系尚未準備好應對毫秒級克隆。模型卡與 README 均設有禁止非同意克隆的條款,並附倫理宣告,但技術本身的中性決定了它易被濫用。 法律層面,未經同意克隆他人聲音正面臨快速演變的監管:美國田納西州 ELVIS 法案、歐盟 AI 法案及各州相關立法均在收緊。開發者在部署前應查閱當地法律並取得授權。此外,語種缺失(尤其亞洲語言)意味著非覆蓋語種使用者當前只能「湊合」或等待後續版本。

  • 如果你需要在本地、無顯示卡環境嵌入語音合成,又不希望被雲 API 的延遲和費用綁架,Pocket-TTS 是目前最值得考慮的方案:整合門檻低、效果「能用」、MIT 可商用。它特別適合端側助手、離線朗讀、隱私敏感應用,以及想給自有 LLM 接上本地嗓子的開發者。 不適合的場景也很明確:追求播音級音質與精細韻律控制的生產級配音,仍應優先 ElevenLabs 等商業方案;需要中文、日文等亞洲語種,或要求穩定跨語言口音時,現階段要謹慎評估。替代路線包括 Kokoro(輕量無克隆)、Kyutai TTS 1.6B(需 GPU、音質更高)、以及 ElevenLabs / Cartesia 等雲端服務。

  • Pocket-TTS 用一個 1 億引數的小模型,把「GPU 級聲音克隆」壓縮排了任意筆記本和手機,是端側 TTS 的正規化級實踐;它真正的天花板不在音質,而在語種覆蓋與濫用防護,這兩點將決定它能否從開發者玩具走向大規模生產。

使用者評論

  • 頭像
    RGonzalezSr1
    中文日文都不支援,亞洲語種只能等後續,遺憾。

  • 頭像
    HAIIN7CU
    做 MCP 伺服器接進工作流了,任務完成自動念播報。比雲端 API 省心也省錢,延遲還低。要說短板就是零樣本克隆上限明顯,想追求高保真說話人相似度還是得微調大模型,不過對端側常駐播報它已經是首選了。

  • 頭像
    Stephanie.ScottII12
    許可有點坑:程式碼是 MIT,但 README 裡塞了 Prohibited Use 條款,跟 MIT 原文矛盾;而且每個預置音色各自有許可(CC-BY、VCTK 都有),真要上線產品得逐個看音色卡。

  • 頭像
    Andrew.Ramos_Max30
    把它接到 Claude Code 當語音播報外掛了,每次任務結束它用我的聲音念一句小結,體驗意外地好。純 CPU 跑毫無壓力。

  • 頭像
    FRichardson520
    音質確實不錯,但 Javert 那個音色念長句會跳詞,讀雙城記開頭直接漏掉半句,已有人提 issue。官方說把文字切小段就穩,湊合能用。

  • 頭像
    DianaWalker_2022
    跨語言克隆能用,但用法語音色念英文會帶魁北克口音,韻律跟著源語言走。想要乾淨外語還是得用對應語言的樣本。

  • 頭像
    Roger_Fisher_20201
    克隆我自己聲音只要五秒音訊,離譜的方便。

  • 頭像
    JCarterQ7
    免費 MIT 可商用,比 ElevenLabs 每月二十二刀香太多。

  • 頭像
    蘭花991
    太香了,純本地零成本。

  • 頭像
    Christopher_ParkerK
    跟 Kokoro 比了一下:固定音色播英文還是 Kokoro 更穩更自然,但 Pocket TTS 勝在能零樣本克隆任意聲音,五秒樣本就能復刻。如果你事先不知道要用誰的音色,選它就對了;要是有一批固定配音,Kokoro 更省心。

  • 頭像
    Janice459
    pip 裝完一行命令就出聲了,新手也能跑。

  • 頭像
    Sharon.Rivera_7
    參考音訊會把房間混響一起復刻,我第一次用帶底噪的錄音,出來聲音像在浴室裡。官方建議先用 Adobe Enhance 之類降噪再克隆,這點是真要注意,不然髒樣本全部照單全收。

  • 頭像
    silverlion482
    實測在 MacBook Air M4 上大概六倍實時,首包兩三百毫秒,只佔兩個核。我做了個瀏覽器擴充套件 pocket-reader,長文一鍵朗讀,比系統自帶的 espeak 自然太多了。本地不上雲這點對隱私黨太友好了。

  • 頭像
    JanetCooper55
    站在安全形度有點慌:我用普通 Ryzen 主機、零技術背景,問 LLM 拿到步驟,十五分鐘就克隆出以假亂真的自己聲音。銀行電話聲紋驗證這套高許可權認證,現在真的該重新審視了,毫秒級克隆把原來的反應視窗徹底抹掉了。