深度报告
-
Vidu S1 是生数科技在 2026 全球数字经济大会上(7 月 3 日)正式发布的实时交互视频基础模型,把 AI 视频从「离线生成一段成片」推进到「持续在线、边聊边生成」的实时互动形态。它的核心指标是 540P(960×540)、稳态 25FPS、峰值 42FPS,端到端延迟普遍压到 3 秒以内,支持语音实时控制角色动作、单张图即时创建数字人、无限时长连续互动。截至目前它已开放小规模线上内测与 API 商用接入,主要面向情感陪伴、虚拟偶像、互动直播、在线教育、车载助手等场景。
-
生数科技由清华大学朱军教授创立,是国内较早专注「通用世界模型」路线的 AI 视频公司,旗下 Vidu 系列此前已凭图生视频、多主体一致性、参考生视频等功能在创作者圈子里站稳脚跟。Vidu S1 由朱军带队的 00 后博士生张金涛担任研发负责人完成全链路开发,定位为通用世界模型在「实时交互式生成」方向上的关键落子。2026 年 7 月 3 日发布当天,生数科技还入选了北京软件和信息服务业协会「2025 年北京市数字经济标杆企业」中的新模式新应用标杆企业,同期也有头部车企宣布其 2026 款旗舰车型将首发搭载 Vidu S1 车载定制版。
-
Vidu S1 最大的变化是交互范式。传统视频大模型是「提交请求 → 等待生成 → 播放结果」的离线流程,而 S1 改成了「实时语音输入 → 逐帧生成 → 持续播放 → 持续响应」。模型在播放当前帧的同时已经在计算后续帧,新语音指令可以即时注入后续生成,让画面随对话实时变化。 在角色创建上,S1 把门槛砍到极低:用户只需上传一张参考图(真人、动漫、萌宠、游戏角色均可),模型当场理解身份、外观与视觉风格,实时生成同步的口型、表情、眼神、手势和肢体动作,无需建模、绑定、口型适配或角色专属训练。声音层面支持系统音色或录制自己的声音做定制,保证视觉身份与发声身份一致。 实测里,语音控制行为是最受关注也最有落差的能力。简单指令如「举起左手」「推眼镜」「撩头发」多数能流畅完成,复合指令(如左手整理头发、右手整理衣襟、双手比心)能勉强做到但不够到位;而转身、跳舞、下蹲等连续大幅动作,系统层面似乎被限制,角色只会小幅晃动,被用户调侃「嘴上答应得积极,身体只象征性晃两下」。延迟客观存在——讲完一句往往要停顿一下角色才回应,放在视频生成里算快,放进视频通话就显得明显,且角色一直盯着你容易让人有压迫感。
-
S1 的实时交互按生成时长扣费。公开资料显示 API 计费约为 3 积分 / 2 秒,每 6 秒扣除一次、按 2 秒周期向上取整,新用户赠送 1000 点免费试用积分(约合 11 分钟实时交互),可体验完整 API、所有声音与语言。积分单价约 0.03125,折算约 2.8 元 / 分钟,一小时约 168 元;内测阶段也有每日基础免费交互时长(带水印、有限帧率、不可商用)。企业侧提供专属 SLA 套餐,可购高并发、去水印、42FPS 全开权限及定制角色 / 声音克隆接入。目前没有固定月度会员,按实际交互时长消耗积分。
-
正面声音集中在「零门槛」和「像真人」。不少体验者认为单图建角色、语音驱动全维行为、无限时长连续对话这三点是代际优势,聊一整晚也不会状态闪退,口型能跟上、记忆能延续前文对话,做 AI 陪伴和虚拟偶像很有「活人感」。有测试者搭建的「高冷学霸」数字人讲题效果好、互动暖,能记住前面聊过的内容并在后续小结。 负面反馈则集中在真实感和延迟。多家媒体实测指出,复杂动作会糊弄、角色描述和实际行为脱节、录制自己的声音偶发不生效而随机切声线;半双工体验(类似对讲机,你说一句它一句,打断它不会闭嘴)被拿来和豆包等纯语音产品对比,认为 10 秒级延迟在「人机恋陪伴」场景里太前现代。网易雷科技一篇体验文标题直接写「问题比想象的要多」,点名延迟大、动作写死、体型和动作不匹配、表情激动时牙齿脸颊偶尔不协调。
-
行业普遍把 S1 视为视频生成赛道从「生成质量竞争」转向「实时交互竞争」的标志性产品。相比 HeyGen、D-ID、Synthesia 等以离线数字人见长的竞品,S1 在交互深度和持续能力上有代际优势,尤其适合需要「真人感」的陪伴、直播和 NPC 场景;但在 4K 影视级画质、精确面部特征调整上仍是短板,离线长片制作反而不如 HeyGen / Synthesia 的更高分辨率与精细编辑。技术侧,它依托生数自研的 TurboDiffusion 推理加速框架与 TurboServe 流式部署引擎,叠加 SageAttention、SLA、SpargeAttention 等注意力优化与模型量化,才在消费级显卡上把实时视频生成的延迟压到及格线。有评论将其与同期 MaineCoon Chat Mode 并列,认为实时视频数字人产品整体还处在「前现代」阶段,但方向明确。
-
主要争议集中在体验预期管理:官方宣传的「语义感知、意图理解、对应安抚反应」与实测存在落差,语音控制行为在复杂指令上不稳定,容易让用户产生「被忽悠」感。半双工、较高延迟在陪伴场景的体感短板,也引发「虚拟陪伴是否真的 ready」的讨论。此外,540P 分辨率对需要高清出镜的电商直播、影视宣发仍是硬限制;角色细节可控性不如 3D 建模方案,也意味着它在高精度专业制作上暂时让位。
-
它适合:想低成本做专属数字人的个人创作者、需要 24 小时在线的直播团队、做 NPC 实时互动的游戏开发者、需要品牌数字人客服的企业,以及想快速验证实时陪伴 / 教育产品的团队。不太适合:追求 4K 影视级画质的专业影视制作、需要复杂多人物大场景或 3D 高精度建模的项目。 使用建议上,个人创作者先用免费额度测试动作与声音匹配度,再决定是否商用;电商、教育等商用团队直接走企业 API 套餐更稳。替代方案方面,纯语音陪伴可选豆包等低延迟产品,离线数字人短片制作可选 HeyGen、Synthesia。
-
Vidu S1 把 AI 视频从「拍一段短片」变成「开一通实时数字人通话」,单图零训练、语音驱动全维行为、无限时长交互三点确实构成代际差异,但延迟、动作可控性与真实感仍是它走向大众陪伴前必须跨过的坎。
用户评论
-
BillyBaker_2023—单图就能捏数字人,门槛真的低。 -
龙昊—540P 画质确实糊,拿它当视频通话还行,当正经出片就别想了。 -
钱怡凤—简单指令「举手」很顺,复合指令就勉强,复杂动作直接糊弄。 -
郭丹丹—体验下来延迟是真不小,你说完一句它还要愣一下才开口。放进视频生成算快,可一旦当成视频通话,这种停顿就特别出戏。 -
傅彤晨—我录了自己的声音想做定制音色,结果完全没生效,画面里随机切男女声,看着相当诡异,这点希望能修。 -
Patrick.Gray—让它「我心情不好」它会做安抚动作,理论上感知情绪挺酷,但实际跟官方宣传的理想状态还有落差,别指望太智能。 -
Virginia.Bell00702—算了一笔账有点劝退:实时交互按 2 秒扣 3 积分,折算差不多 2.8 元一分钟,一小时就是一百六。我前后砸了两千多积分、一千多秒连线才把整套多模态闭环评测跑完,个人玩玩免费额度够了,但真要拿来做电商直播或者陪伴,长尾成本得先算清楚,不然几分钟就烧没了。建议商用团队直接走企业 API 套餐,别拿免费额度硬扛。 -
AXmoo—用自动化脚本接了 API 跑压测,预设角色库从最早 6 个扩到 11 个,迭代速度挺猛。两组长时对话下来画面基本钉在 25 帧、零抖动,聊久了脸也没漂,工程稳定性确实比想象中稳。我用 Claude 一个多小时就跑通了接入,连哈兰德和沃齐尼亚都拉来做了中英文压测。就是接入要啃文档加阿里云 ARTC SDK,对纯小白来说门槛不低,但愿意折腾的程序员基本一天能上手。 -
JRogersZ—消费级显卡就能跑 540P 实时生成这点很香,小团队和个人创作者不用堆 A100 也能落地,本地部署门槛被砍了一大截。 -
ticklishgorilla525—跟 HeyGen、D-ID 比的话,S1 在交互深度和持续对话上确实是代际领先,但 540P 分辨率摆在那,正经影视级制作还是得靠离线方案,定位要分清楚。