Kyutai Pocket-TTS

1 亿参数的开源端侧语音合成模型,CPU 实时运行、5 秒音频即可克隆任意声音

深度报告

  • Pocket-TTS 是法国开源 AI 实验室 Kyutai 于 2026 年 1 月发布的轻量级文本转语音(TTS)模型,参数仅 1 亿、可在 CPU 上实时运行,并具备零样本声音克隆能力。它填补了「大模型音质」与「小模型轻量」之间的空白:既能像 10 倍体量的模型那样克隆任意声音,又不需要 GPU。2026 年 5 月,Kyutai 又为其补齐了英、法、德、西、葡、意六种语言。

  • Kyutai 是一家位于巴黎、以开放科学(open science)为信条的 AI 研究实验室,目标是构建并 democratize 通用人工智能。实验室由法国电信巨头 Iliad(Free 母公司)创始人 Xavier Niel 等人出资支持,走完全开源路线,此前已推出实时语音对话系统 Moshi、流式 TTS 模型 Kyutai TTS 1.6B、低延迟流式语音编解码器 Mimi 等。 Pocket-TTS 脱胎于 Kyutai 语音研究,核心论文依据是 2025 年发表的「Continuous Audio Language Models(CALM)」框架。项目作者包括 Manu Orsini、Simon Rouard、Gabriel De Marmiesse、Václav Volhejn、Neil Zeghidour、Alexandre Défossez 等人,代码与权重以 MIT 许可证在 GitHub 开源,模型卡托管于 Hugging Face。训练数据全部为公开英文语料,累计约 8.8 万小时音频(AMI、EARNINGS22、GIGASpeech、SPGISpeech、TED-LIUM、VoxPopuli、LibriHeavy、Emilia 等),刻意只用公开数据以保证可复现性。

  • Pocket-TTS 的生成模型(因果 Transformer + MLP 头)仅 9000 万参数,编解码器解码端 1000 万,合计 1 亿;声音编码端另有 1800 万参数,仅在编码参考音色时调用一次。它最大的工程突破是彻底抛弃了传统 TTS 的离散音频 token,改为直接预测连续隐变量(continuous latents),配合 Lagrangian Self-Distillation(LSD)实现单步采样,从而把模型压到极小而不损失质量。 声音克隆是它最亮眼的能力:只需约 5 秒参考音频,即可零样本复刻音色、情绪、口音、语速乃至混响与麦克风声学条件,全程无需微调或标注说话人数据。用户可使用内置音色库(如 Alba、Marius、Javert、Jean、Fantine、Cosette、Eponine、Azelma 等,多为《悲惨世界》角色名),也可上传自己的音频样本。 部署极简。安装 uv 后一条命令即可起本地服务(`uvx pocket-tts serve`)或命令行生成(`uvx pocket-tts generate`);也支持 Python API(`from pocket_tts import TTSModel`)。官方维护的 pocket-tts-js 版本基于 WebAssembly/WebGPU,可在浏览器标签页内纯客户端运行,模型下载后全程不再调用服务器。 速度表现突出。在 MacBook Air M4 上约 6 倍实时(6x real-time),首包延迟约 200 毫秒,仅占用 2 个 CPU 核心;Intel Core Ultra 7 165H 与 Apple M3 上也明显快于实时。在 Kyutai 的横向测试中,F5-TTS(3.36 亿)、Kyutai TTS 1.6B(7.5 亿)、Chatterbox Turbo(3.5 亿)均无法在 CPU 上实时运行,只有 Kokoro(8200 万,但无声音克隆)和 Pocket-TTS 能做到。

  • Pocket-TTS 完全免费、MIT 协议、可商用。它本身不卖订阅、不收 API 费,靠开源社区与 Kyutai 的科研经费维持。对比之下,商业 TTS 标杆 ElevenLabs 最低档约每月 22 美元起。Kyutai 的商业模式更像是「研究即产品」:通过开源模型建立生态与影响力,再由其首家衍生公司 Gradium 把语音研究转化为可规模化的生产级系统。开发者若要在产品内嵌本地语音功能,几乎零成本接入口袋模型即可。

  • 正面反馈集中在「门槛极低」与「本地可控」。不少用户称从空白终端到克隆出自己声音不到十五分钟,pip 安装、一行命令即可生成,且全程在本地 CPU 完成,无需显卡、不上云,隐私性天然占优。社区(如 r/LocalLLaMA)将其与 Kokoro、Supertonic、Inflect-Nano 并列做英文 TTS 基准,认可它是唯一能「在 CPU 上克隆声音、无需 GPU」的开源方案。 负面与局限同样明确。其一,音质仍不如大参数模型:客观指标上 Pocket-TTS 词错率(WER 1.84)与 F5-TTS、Kyutai TTS 1.6B 接近,但音频质量 ELO(2016)低于 Chatterbox Turbo(2055)等;追求播音级音质时它仍是「能用」而非「惊艳」。其二,克隆效果高度依赖参考音频质量,脏样本会被如实复刻。其三,截至 2026 年 5 月官方仅支持英、法、德、西、葡、意六种语言,尚无中文、日文、韩文、阿拉伯语等,跨语言克隆时口音会跟随源音色(如用法语音色念英文会带魁北克或外来口音)。其四,社区生态尚在早期,遇到坑得多翻 GitHub Issues。

  • 行业普遍把 Pocket-TTS 视为「小模型补上声音克隆」的关键一步。技术报告给出了硬核证据:在 Librispeech test-clean 上,它 WER 最低(1.84),音频质量 ELO(2016)优于 ground truth 与 F5-TTS、DSM,说话人相似度 ELO(1898)与 ground truth 持平,却只有对手几十分之一的参数量。媒体评测认为它重新定义了「端侧 TTS」的边界——把原本需要 GPU 的克隆能力塞进了笔记本和手机。 与竞品格局对照:Kokoro(8200 万)更轻但音色固定、无克隆;Kyutai TTS 1.6B 音质更强但需 GPU;ElevenLabs 绝对音质与语种覆盖领先,但收费且走云 API。Pocket-TTS 的定位很清晰——做 agent 内嵌、本地常驻、隐私优先场景的务实之选。

  • Pocket-TTS 5 秒克隆、零门槛、纯本地运行的特性,也把声音伪造的门槛拉到了地板。xda-developers 的一篇亲测文章直言,作者用普通 Ryzen CPU、无任何技术背景,靠问 LLM 拿到步骤,15 分钟内就复刻出以假乱真的自己声音,并担忧银行电话声纹验证体系尚未准备好应对毫秒级克隆。模型卡与 README 均设有禁止非同意克隆的条款,并附伦理声明,但技术本身的中性决定了它易被滥用。 法律层面,未经同意克隆他人声音正面临快速演变的监管:美国田纳西州 ELVIS 法案、欧盟 AI 法案及各州相关立法均在收紧。开发者在部署前应查阅当地法律并取得授权。此外,语种缺失(尤其亚洲语言)意味着非覆盖语种用户当前只能「凑合」或等待后续版本。

  • 如果你需要在本地、无显卡环境嵌入语音合成,又不希望被云 API 的延迟和费用绑架,Pocket-TTS 是目前最值得考虑的方案:集成门槛低、效果「能用」、MIT 可商用。它特别适合端侧助手、离线朗读、隐私敏感应用,以及想给自有 LLM 接上本地嗓子的开发者。 不适合的场景也很明确:追求播音级音质与精细韵律控制的生产级配音,仍应优先 ElevenLabs 等商业方案;需要中文、日文等亚洲语种,或要求稳定跨语言口音时,现阶段要谨慎评估。替代路线包括 Kokoro(轻量无克隆)、Kyutai TTS 1.6B(需 GPU、音质更高)、以及 ElevenLabs / Cartesia 等云端服务。

  • Pocket-TTS 用一个 1 亿参数的小模型,把「GPU 级声音克隆」压缩进了任意笔记本和手机,是端侧 TTS 的范式级实践;它真正的天花板不在音质,而在语种覆盖与滥用防护,这两点将决定它能否从开发者玩具走向大规模生产。

用户评论

  • 头像
    RGonzalezSr1
    中文日文都不支持,亚洲语种只能等后续,遗憾。

  • 头像
    HAIIN7CU
    做 MCP 服务器接进工作流了,任务完成自动念播报。比云端 API 省心也省钱,延迟还低。要说短板就是零样本克隆上限明显,想追求高保真说话人相似度还是得微调大模型,不过对端侧常驻播报它已经是首选了。

  • 头像
    Stephanie.ScottII12
    许可有点坑:代码是 MIT,但 README 里塞了 Prohibited Use 条款,跟 MIT 原文矛盾;而且每个预置音色各自有许可(CC-BY、VCTK 都有),真要上线产品得逐个看音色卡。

  • 头像
    Andrew.Ramos_Max30
    把它接到 Claude Code 当语音播报插件了,每次任务结束它用我的声音念一句小结,体验意外地好。纯 CPU 跑毫无压力。

  • 头像
    FRichardson520
    音质确实不错,但 Javert 那个音色念长句会跳词,读双城记开头直接漏掉半句,已有人提 issue。官方说把文本切小段就稳,凑合能用。

  • 头像
    DianaWalker_2022
    跨语言克隆能用,但用法语音色念英文会带魁北克口音,韵律跟着源语言走。想要干净外语还是得用对应语言的样本。

  • 头像
    Roger_Fisher_20201
    克隆我自己声音只要五秒音频,离谱的方便。

  • 头像
    JCarterQ7
    免费 MIT 可商用,比 ElevenLabs 每月二十二刀香太多。

  • 头像
    兰花991
    太香了,纯本地零成本。

  • 头像
    Christopher_ParkerK
    跟 Kokoro 比了一下:固定音色播英文还是 Kokoro 更稳更自然,但 Pocket TTS 胜在能零样本克隆任意声音,五秒样本就能复刻。如果你事先不知道要用谁的音色,选它就对了;要是有一批固定配音,Kokoro 更省心。

  • 头像
    Janice459
    pip 装完一行命令就出声了,新手也能跑。

  • 头像
    Sharon.Rivera_7
    参考音频会把房间混响一起复刻,我第一次用带底噪的录音,出来声音像在浴室里。官方建议先用 Adobe Enhance 之类降噪再克隆,这点是真要注意,不然脏样本全部照单全收。

  • 头像
    silverlion482
    实测在 MacBook Air M4 上大概六倍实时,首包两三百毫秒,只占两个核。我做了个浏览器扩展 pocket-reader,长文一键朗读,比系统自带的 espeak 自然太多了。本地不上云这点对隐私党太友好了。

  • 头像
    JanetCooper55
    站在安全角度有点慌:我用普通 Ryzen 主机、零技术背景,问 LLM 拿到步骤,十五分钟就克隆出以假乱真的自己声音。银行电话声纹验证这套高权限认证,现在真的该重新审视了,毫秒级克隆把原来的反应窗口彻底抹掉了。