深度报告
-
Synthesia 是总部位于伦敦的企业级 AI 数字人视频平台,2017 年由 Victor Riparbelli 与一批 UCL 出身的 AI 研究员创立。用户输入文字脚本,即可生成由虚拟主播播报、口型对齐、自带多语种配音的「播报式」视频,广泛用于企业培训、内部沟通和产品讲解。产品速递将其记为「Synthesia 2」,这一叫法并非官方单一代际——公司正式的现行代际是 Synthesia 3.0(2025 年 10 月发布),其底层驱动是 2025 年 9 月推出的 Express-2 全身数字人引擎。本报告以 Synthesia 3.0 / Express-2 这一当前可验证主线为基准撰写,命名口径差异留人工审核。
-
Synthesia 是少数跑通「AI 数字人视频」商业闭环的独立公司,未被大厂收编。其融资节奏印证了赛道热度:2025 年 1 月完成 Series D,估值 21 亿美元;2026 年 1 月再获 GV(Google Ventures)领投的 2 亿美元 Series E,估值翻倍至 40 亿美元,投资方还包括 NVIDIA、Accel 等。营收同样陡峭——年经常性收入(ARR)从 2024 年底的 8800 万美元,增至 2025 年 9 月的 1.46 亿美元。据官方与第三方资料,超过 90% 的财富 100 强企业在使用该平台,累计服务企业数超 6 万家。2026 年 4 月,公司宣布在奥斯汀、柏林、巴黎、苏黎世设立办公室,并计划扩招 70% 人手。
-
Synthesia 的核心工作流是从「脚本到成片」:选一个虚拟主播、写或生成脚本、配置场景与配音、一键渲染导出。2025 年的两次大升级构成了今天的产品骨架。 其一是 Express-2 数字人引擎(2025 年 9 月)。与上一代 Express-1(2024 年 4 月,仅做面部表情)不同,Express-2 用扩散 Transformer 渲染全身——手势、姿态、重心转移都随语义自然变化,配合微表情(眨眼、挑眉、浅笑)与稳定的眼神接触,在 1080p/30fps 下输出。实测中,数字人会在强调处用手势、在转场时换姿态,正常播放速度下基本能越过「像真人」的及格线。其二是 Synthesia 3.0(2025 年 10 月),新增几项关键能力:Video Agents——可嵌在视频任意位置的虚拟主播,能与观众实时双向对话,调用连接的知识库(SharePoint、Google Drive、CRM)回答问题、跑培训或初筛候选人,目前面向企业客户分阶段推出;AI Playground——直接在编辑器内调用 Sora 2、Veo 3.1、FLUX.2 生成电影感 B-roll 素材,无需跳出工作流;以及基于提示词的形象/着装生成,和「单张照片即可生成个人数字分身」的 Personal Avatar。 配音侧,Express-Voice 是两段式 Transformer 语音克隆系统(每段 8 亿参数),数秒复刻音色、保留口音与语调节奏。AI Dubbing 可将一段视频译制为 130+ 语种并保持帧级口型对齐,一键翻译则做脚本级翻译。平台内置 240+ 个库存数字人、支持 160+ 语种文字转语音,并提供实时协作、Brandkit 品牌套件、版本控制、SCORM 导出(对接 LMS)和播放分析。
-
2026 年 4 月的定价采用「分钟额度」年付制:免费版每年 36 分钟、9 个库存形象(带水印);Starter 每月 29 美元(年付 18 美元),每年 120 分钟、70+ 形象;Creator 每月 89 美元(年付 64 美元),每年 360 分钟、解锁全量库存;Enterprise 为定制报价,含 SSO、审计日志、SCORM、API、Veo 3 等。Personal Avatar(个人数字分身)另计,约 1000 美元/年。需提醒的是,SCORM 导出与一键翻译等被多篇评测指为「企业版专属」或需销售谈判才能开通,常有「建好课程才发现用不了」的落差。API 已从纯企业版下放到 Creator 版,用于程序化批量生成。
-
正面集中在其易用与多语言能力:零视频经验者 15 分钟内可产出成片,90% 用户无需教程即可发布首条视频;一次拍摄的英文培训片,能快速译制成数十个语种版本,对全球 L&D 团队价值直接。负面则高度集中于内容审核:这是最多的投诉项——合规的商业内容会被无明确理由地拦截或封禁,人工复核往往要 12–24 小时,非企业客户没有优先级;有用户报告账号在 30 分钟内因模糊违规被封。退款政策严格、自定义形象制作偏慢(需数日复核)也是常见槽点。另有用户反映高峰时段渲染会拖到 15–20 分钟,Starter 每月 10 分钟额度极易触顶、被迫 4 倍价升级。
-
在独立评测中,Synthesia 综合口碑偏正面:G2 约 4.7/5(2000+ 评价)、Trustpilot 约 4.3/5(300+)、PlainAI 4.0/5。行业普遍将其定为「企业培训/内部沟通视频」的标准答案,对手 HeyGen 则在低门槛写实度、175+ 语种译制深度、按量计费 API 与性价比上更占优,但治理与审核更松。Runway、Sora、Kling 等通用生成视频模型正从「电影感 B-roll」一侧挤压纯数字人播报品类;Colossyan 在培训场景的原生互动、D-ID 在 API 化照片驱动上各有卡位。Synthesia 的护城河在于合规资质(SOC 2 Type II、GDPR、ISO/IEC 42001 AI 管理体系、SAML/SSO)与 90%+ 财富 100 强的采购惯性。
-
最大风险是内容审核的不可预测性:受监管行业(医疗、金融、法律)用户可能因一次轻微编辑导致已通过视频被重新标记,投入的工时付诸东流;平台官方文档承认审核不完美,但未公开清晰的申诉流程,非企业客户无优先通道。其次是合规缺口——截至 2026 年 3 月,Synthesia 与 HeyGen 均未公开 HIPAA 业务伙伴协议(BAA),涉及患者或客户数据的受监管买家需签约前单独索取。再次是写实度天花板:2026 年盲测中 64% 的观众能正确识别 AI 数字人(2024 年为 89%),近景下仍显合成感,不适合情感叙事或电影化内容。HIPAA、严格退款、分钟额度紧绷与渲染延迟共同构成落地摩擦。
-
Synthesia 最适合:需要规模化、可更新、多语种企业培训与内部沟通的视频团队;看重合规资质与 LMS 集成的组织。它不适合:追求人格化、幽默感或电影质感的创作者;预算极紧、仅偶尔产片的个人(免费版或更便宜工具更划算);需要 HIPAA 级合规医疗内容的团队(需先确认 BAA)。若主要做对外营销,HeyGen 往往性价比更高;若做分支式互动培训,Colossyan 的原生互动更强。建议先用免费版产出一条真实业务视频,确认能过审且形象贴合后再考虑付费。
-
Synthesia 3.0 / Express-2 把「打字生成播报视频」这件事做到了企业级的水准,真正的长板在合规、规模与多语种训练视频,短板在审核的不确定性、写实度天花板与按分钟计费的压力——它是专家型工具,不是万能机器。
用户评论
-
Lilly694—口型近看还是有点假,客户问过两次。 -
CHwhi—和 HeyGen 比,Synthesia 在企业合规、LMS 集成上稳得多;但写实度和多语种深度 HeyGen 更强,看你用在哪。 -
Henry.GonzalesJr—express-2 之后手势和姿态终于像真人了,强调处会用手比划,正常速度看基本过关,近景还是能看出是合成的。 -
IsaiahNgyyen—Trustpilot 上 4.3 分在 AI 工具里算异常高,负面基本集中在审核和退款,正常用其实挺稳的。 -
KathleenMiller_Pro03—零视频基础,二十分钟就出片,太顺手了。 -
Sean_Flores369—退款政策挺严的,短期订阅基本不退。 -
唐琪_1—免费的 10 分钟额度,一条就没了,坑。 -
CCastilloQ03—AI Playground 里直接调 Sora 2 和 Veo 3.1 生成 B-roll 是真香,不用跳出工作流也不另付 API 费,这是和竞品拉开差距的地方。但没有时间轴编辑,想逐帧微调根本做不到,改个逗号都要重新渲染等八到十二分钟,重度迭代会很磨人。 -
AMoore_66—数字人库是见过最全的,我居然找到一个长得像我的。就是 Starter 的分钟限额太别扭,后来升了档才好用。 -
JRichardson_20230—语音克隆几秒出声,口音语调都保住了,牛。 -
GloriaReev—我们团队把 40 页的 PPT 一天之内转成了完整视频课程,它居然会读演讲者备注生成配音,离谱地好用。不过长视频渲染是真慢,有次五分钟以上的片子直接导出超时,后来我们都习惯先把文案锁死再点生成,省事不少。 -
DylanPerez_2022—Personal Avatar 现在一张照片就能做,以前要录几分钟视频,速度提升巨大,做数字分身终于不痛苦了。 -
DianeCollins_2024—注册一小时就做出第一条视频了,界面真清爽。 -
ANjoh—多语种译制是真的救命,一个英文培训片直接翻成德文法文,省掉三次重录。质量大概九成到位,就是德文版偶尔口型比声音慢半拍,客户凑近看会问,但整体还是甩同行一条街,尤其对全球 L&D 团队,长期看特别值。 -
MariaSanchez—盲测里 64% 的人能认出是 AI 数字人,比 2024 年的 89% 低了不少,说明写实度确实在涨,express-2 之后手势姿态像真人了。语音克隆也狠,盲测 72% 分不清真人,但真要做情感叙事或电影感内容它还是不行,那是另一类工具的事。 -
LambdaLPWood—我们做全球入职培训,同一门课要存在六七种语言里。以前每上个市场重录一次,现在上传英文版一键译制,两小时搞定。省下的真金白银比订阅费多太多了。就是自定义形象要走同意流程,不是秒出,运营上有一点开销,但可接受。 -
DeborahCarter—Starter 那 10 分钟每月额度纯属玩笑,一个片子就烧光,逼着你升 Creator,实际月费直接翻四倍,签约前真不会告诉你。 -
JReed_Pro—高峰时段渲染能拖到十五二十分钟,长视频更夸张。我们后来学乖了,先把文案锁死再生成,绝不生成后再改逗号。 -
Lawrence.CampbellZ—内容审核是我最想吐槽的:正经商业内容会被无理由拦下来,人工复核动辄 12 到 24 小时,非企业客户还没优先级。而且近景下数字人还是能看出是合成的,要是你的流程经不起这突如其来的延期,这是个真风险,得留缓冲。 -
HashNet_pro—SCORM 导出居然是企业版专属,建完课程才发现,得找销售要报价,体验像钓鱼。 -
TIram—做 HR 合规课每季度都要更新,以前拍片子要折腾一整天,现在改脚本重新生成数字人视频一小时就搞定,企业版是贵但替换掉的东西值这个价。不过做对外营销我还是更偏向 HeyGen,翻译和写实度更顺,Synthesia 强在内部培训和 LMS 集成。