Google Vids (Omni)

Google Vids 整合 Gemini Omni 多模态模型,支持文字与图片生成视频、对话式编辑和个人 AI 化身功能,让企业用户无需专业剪辑技能即可制作高质量视频

詳細レポート

  • 2026 年 7 月,Google 为旗下的 AI 视频创作工具 Vids 注入了两项重大更新——Gemini Omni 多模态视频模型和个人 AI 化身功能,使 Vids 从一个辅助办公的演示工具一跃成为「全能型 AI 视频工作室」。Gemini Omni 支持文字+图片混合输入生成视频、对话式逐步编辑、物理世界理解等突破性能力;个人化身功能则让用户上传一张自拍和一段语音就能生成数字分身,「主演」自己的视频。这两项更新不仅拉高了 AI 视频生成的技术天花板,也在企业市场中直接挑战 Synthesia、HeyGen 等独立新创的定位。

  • Google Vids 最早于 2025 年作为 Google Workspace 的全新应用推出,定位是企业内部视频制作辅助工具。在初期阶段,用户可以在 Vids 中撰写脚本、选择模板、搭配背景音乐,生成简单的讲解式视频。2026 年 2 月,Google 将 Veo 3.1 模型整合进 Vids,让用户能够直接通过文本生成视频片段,初步建立了 AI 视频生成的能力基座。 但真正的分水岭出现在 2026 年 5 月的 Google I/O 大会上。Google DeepMind 发布了一款全新的多模态模型——Gemini Omni,它并非 Veo 系列的迭代升级,而是一个「从地基重新设计」的新物种(Google DeepMind 产品负责人 Nicole Brichtova 在访谈中用了「step change」来形容这种跨越)——它的训练目标从第一天起就是「多模态进、多模态出」,图像、音频、视频、文本不是训练时的附加条件,而是模型理解世界的原始数据。这一架构上的根本性差异,让 Omni 在视频编辑、风格迁移、场景续写等任务上展现出「涌现」能力——即模型能做的事情超出了训练数据中显式出现过的场景。 2026 年 7 月 16 日,Gemini Omni 正式进入 Google Vids,成为产品历史上规模最大的一次更新。同时发布的还有个人 AI 化身功能,此前该功能已经在美国向所有 Google 账户持有人免费开放测试。根据 Google 官方数据,Vids 目前月活跃用户已超过 700 万。

  • 文字+图片混合生成。Gemini Omni 在 Vids 中的核心能力是「多模态视频生成」。用户不仅可以用自然语言描述想要的画面,还可以同时上传参考图片(比如一张产品照片甚至随手画的草图),模型会将文字与视觉信息融合,生成与用户脑海中的画面更接近的视频。这和传统 AI 视频工具「只认提示词」的工作方式有本质区别——用户不再需要苦思冥想地写 prompt,用一张照片就能解决「千言万语说不清」的问题。 对话式编辑。这可能是 Omni 提升体验最明显的地方。过去 AI 生成的视频如果不满意,通常只能删掉重来。Omni 支持增量式、对话式的视频编辑:用户可以说「把背景换成海滩」「把光线调亮」「在结尾加一个淡出效果」,模型会只修改指定的片段,而其他保持审核通过的内容不变。这种「逐帧可调」的体验让 AI 视频制作流程更接近传统的非线性剪辑,而不是反复生成整个片段赌运气。更值得注意的一点是,Omni 同样可以编辑用户自己用手机拍摄的视频——换背景、调色、去噪,全在对话框里用文字完成。 渐进式编辑(Progressive Editing)。传统的 AI 视频工作流中,如果用户对画面某一帧不满意,修改文字描述后通常需要从头重新生成整段视频,浪费时间且每次生成的结果也不一致。Omni 的渐进编辑只重新生成用户不满意的几秒画面,已通过的片段保持不变。这种能力大幅提升了创作效率和迭代灵活性。 物理世界理解与复杂概念可视化。根据 Google DeepMind 的说法,Omni 在训练时融入了对重力、动能、流体力学等物理规则的学习,结合 Gemini 模型本身的历史、科学和文化知识,实现了从「画得真」到「讲好故事」的跨越。实测中,Omni 可以生成弹珠在连锁轨道上运动的物理模拟场景,也能将蒙娜丽莎从画作缩放到颜料分子再到原子级别的讲解式视频。中文媒体的实测也显示,Omni 能理解「玄武门对掏」这样充满中式文化梗的提示词,虽然细节上仍有瑕疵(中文口音不够自然、偶有物理穿模),但从理解力来看,Omni 确实跨出了 AI 视频工具的重要一步——它不再只是「生成画面」,而是在「模拟世界」。 个人 AI 化身。功能流程极其简单:上传一张自拍照→录制一段简短语音样本→输入想说的文字脚本→AI 用你的脸和声音朗读出来。Google 使用了多角度面孔采集和朗读随机数字录音的安全验证流程,化身严格绑定账户持有人的 Google 账号,不可冒用他人形象。化身控制方面,Vids 还提供了 Steering Tags 功能,用户可以在脚本文本中嵌入 [excitedly] [warmly] 等方括号指令来控制情感语调和节奏,甚至可以指挥化身在画面中行走、说话或操作物件。 SynthID 数字水印。所有 AI 生成的视频片段都会嵌入 DeepMind 开发的 SynthID 不可见数字水印,同时支持 C2PA 跨平台元数据,即使视频被剪辑搬运压缩,水印依然可以追踪溯源。

  • Gemini Omni 和个人化身功能面向 Google AI Pro 和 Ultra 订阅用户以及 Google Workspace 商业客户提供。没有无限额度方案,AI 化身每月约 25 次生成额度,视频片段约 50 次,额度每月初重置:Google Workspace 商业版:月费制,内置 25 次化身额度 + 50 视频片段额度Google AI Pro:月费制,额度同上Google AI Ultra:月费制,额度同上美国个人账户(免费试用):有限额度个人化身功能目前仅限 18 岁以上用户在特定地区使用,欧洲经济区、英国、瑞士暂不支持。Google 的策略不是靠 Vids 直接收费,而是将其作为 Workspace 生态的增值能力来提升套件整体价值和用户黏性——这是一种典型的「生态竞争」路径。

  • 正面评价集中在易用性和整合度。Android Authority 的评测认为,Google Vids 配合 Gemini Omni 让「视频编辑终于变得不用学就会了」。用户普遍对自然语言编辑的体验给予肯定——「更换背景」「调整光线」这些在传统剪辑软件中需要多步骤操作的事情,现在一句话就能完成。个人化身功能尤其受到企业内部培训团队和市场营销人员的欢迎,他们可以不用架设摄影棚就制作出有真人出镜的产品演示和培训视频。 负面反馈集中在精细控制不足和地区限制。中文媒体的实测文章指出,Omni 在中文语音合成上还存在口音不自然的问题,对于较为复杂的台词修改指令,模型有时候会「听不懂」,出现新台词覆盖不全或口型与声音不匹配的情况。此外,物理模拟在某些场景下仍有轻微的穿模和失真。个人化身的地区限制也是一个高频吐槽点——EEA、英国等区域的用户目前无法使用化身功能。还有一些用户认为每月 25 次化身生成额度偏低,对于高频制作场景来说不够用。

  • 行业分析师普遍认为,Gemini Omni 是 AI 视频领域继 OpenAI Sora 之后的又一次「范式级跃迁」。TechCrunch 的评价很具代表性——「Google 正在把 AI 化身生成从独立新创市场拖进预设的 Workspace 工具箱」。这意味着 Synthesia 和 HeyGen 等独立 AI 视频平台的竞争格局正在被改写:Google Vids 原生集成在 Google Workspace 中,用户在 Docs 里写好的脚本可以直接拖进 Vids 生成视频,组织架构、权限管理、协作流程全在一套系统里闭环。对于已经使用 Google Workspace 的数亿企业用户来说,这种「零摩擦」的整合体验是独立工具难以复制的。 太平洋科技等中文媒体将 Gemini Omni 比作「视频界的 Nano Banana 时刻」,认为其意义不仅在于视频生成能力,更在于 Google 展示了一条从「预测文本」到「模拟现实」的技术路线。而 a16z 投资人 Justine Moore 则强调,Omni 的对话式编辑和数字分身是两个让它从竞品中脱颖而出的关键特性。 但也有分析指出,Google 在 AI 视频领域并非没有挑战——Omni 在视频画质和一致性上尚未全面超越 Sora 的最新一代模型,且 Vids 作为企业办公工具的产品定位,决定了它不太可能成为专业影视创作者的优先选择。

  • 数字身份的安全隐患是最大的灰色地带。虽然 Google 设置了活体验证、账户绑定、年龄限制等防护措施,但数字人技术一旦开放,必然会被用于制作虚假信息内容。Google 通过 SynthID 水印提供追溯能力,但水印是否能经得起专业攻击者的对抗性测试,目前仍是一个开放问题。 地区合规风险也值得注意。个人化身功能目前不支持欧洲经济区、英国等市场,这与 GDPR 等隐私法规中对生物特征数据采集和处理的严格要求直接相关。对于中国市场,Google Workspace 本身无法直接访问,因此 Vids 的功能不会直接影响国内用户,但 SynthID 的水印策略和数字人安全规范对国内 AI 视频行业有参考价值。 AI 生成内容的可靠性问题。中文媒体的实测发现,Omni 在细节上有一些明显 bug——物理模拟中偶有穿模和「球体分裂」等不符合现实的结果,中文语音合成仍有明显的电子感。这些瑕疵在普通用户友好的宣传视频中可能被放大,影响用户对 AI 视频工具体验的信任度。 对独立新创的挤压。Synthesia 和 HeyGen 等新创公司依靠 AI 视频工具在近几年快速成长,HeyGen 在 2026 年已实现年化收入突破 2 亿美元。Google 的入局意味着这些公司不仅要面对巨头的技术竞争,还可能失去通过 Google Workspace 生态触达企业的渠道优势。长期来看,AI 视频工具的独立市场空间可能被挤压,企业级用户可能会更倾向于选择「全家桶」方案。

  • 适合:企业内部培训部门、市场营销团队、销售团队等需要高频制作视频内容但缺乏专业剪辑能力的机构用户;已经使用 Google Workspace 的企业,Vids 的整合体验远超独立工具;需要快速制作产品演示、团队沟通、教学视频的个人创作者。 不适合:追求电影级画质的专业影视制作人;需要在欧洲经济区或英国使用个人化身功能的用户;需要无限量、高频次生成视频的生产团队(额度的月度限制可能成为瓶颈)。 替代方案:Synthesia(企业培训视频领域市场份额领先)、HeyGen(年收入已破 2 亿美元、支持更广泛的语言和数字人风格)、D-ID(在 AI 数字人交互场景有差异化优势)、剪映专业版/即梦(面向中文用户的本地化 AI 视频工具)。

  • Google Vids 加上 Gemini Omni,让 AI 视频创作的走向从「一个人打字的独角戏」变成了「全公司能协作的低门槛方案」。Omni 从地基重新设计的多模态架构让它具备了对话式编辑和物理理解等突破性能力,而个人化身功能则在合规和安全之间取得了一定的平衡。对企业用户来说,如果已经在用 Google Workspace,Vids 现在可能是起步成本最低的 AI 视频方案之一——它不完美(中文语音还有进步空间、额度有限、部分地区没有化身功能),但方向是对的。Google 正在把「人人能拍视频」这件事从口号变成产品。

ユーザーレビュー

  • 头像
    WestonKristensen
    用 Vids 做了个部门季度汇报视频,以前找设计外包要等一周,现在自己打字加几张截图,十分钟搞定初版。对话式编辑确实好用,说「换个深色背景」它就换了,不用学剪辑真的爽。

  • 头像
    Pglar
    用分身给女朋友发了段生日祝福,她竟然没发现是AI!这技术藏不住了。

  • 头像
    xEmiliaKoski_x
    官方演示里那个「玄武门对掏」的视频我看了,笑死。虽然理解了中国梗,但俩唐代人物说中文那个口音也太奇怪了,感觉像在听AI念课文。

  • 头像
    JoseAlvarez_7
    有没有人对比过 Vids 的化身和 Synthesia 的?我用 Synthesia 一年了,就数字人的自然度来说,Vids 的好处是跟 Workspace 集成深,但 Synthesia 的语言和多风格支持更广,各有所长吧。

  • 头像
    AmandaNelsonIII
    会打字就能剪视频的时代来了。

  • 头像
    Teresa_Mitchell_2022
    请问 Vids 里的 Omni 生成的视频可以商用吗?想用在公司官网首页的产品宣传上,不知道有没有什么限制。

  • 头像
    Phillip.RobinsonQ
    最烦的是地区限制。我在英国出差,想试试个人分身功能,直接提示不支援。都 2026 年了还得看地区分批开放,Google 什么时候才能全球同步上?

  • 头像
    Amber_Garcia_99
    我们人事部试了个人分身功能,录了段入职培训视频。上传自拍加读一串数字,生成的数字人说话口型居然对得上。不过额度有点少,一个月25次分身额度做个系列培训就不够用了。

  • 头像
    Gregory_Mitchell_2021
    分享个小技巧:想让化身的情感自然一些,可以在脚本里加 Steering Tags,比如 [excitedly] 或者 [warmly],生成的语调会有明显变化。不需要手动加的话,下一步还有个自动标签的选项可以一键搞定。

  • 头像
    Jean_Foster_2020
    用了三天 Vids,回不去了。

  • 头像
    GCooper007559
    做教学视频的最佳搭档,没有之一。

  • 头像
    MsAnthonyHarcourt_dev
    要做产品 Demo 视频的话,建议先用 Google Slides 做好逐页稿,再导入 Vids 转成视频框架,比直接在 Vids 里从头写脚本效率高一倍。

  • 头像
    梁海刚
    试了试 Omni 的文字加图片混合生成,给了张产品草图加一段描述,出来的效果比我预期的要好很多,居然把我的草图里的细节都还原了。这个比纯文字 prompt 靠谱太多。

  • 头像
    Sarah_Bell168405
    额度是真的少,AI 化身一个月 25 次,视频片段 50 次。我做了两个视频就用了大半额度,月中就卡住了。这不就是逼人买更贵的方案吗。

  • 头像
    RoyAlvarez007
    限地区、限年龄、限额度的产品真的很劝退。

  • 头像
    LButlerQ48
    合成的那个走路姿势也太假了吧,根本没法用。

  • 头像
    Dylan_FisherX
    我现在用 Workspace Business Standard,查了一下好像没有包含 AI 化身功能。是要额外买 AI 附加包才能用吗,还是有哪个套餐是自带这个的?

  • 头像
    JohnnyTorres369
    有人试过中文输入的编辑效果吗?比如说「把背景换成竹林」,它理解得了吗?

  • 头像
    海角_14
    Omni 物理理解确实进步了,但也没官方吹的那么神。生成弹珠轨道那个测试,后半段一个小球突然变两个,这种 bug 放在正式版里不应该吧。

  • 头像
    yellowmouse158
    团队内部试用了 Google Vids 做客户 Demo 视频,对我来说最大的价值是协作。之前用 HeyGen 做视频,改一版发来发去非常麻烦。Vids 直接在 Workspace 里共享,像改文档一样改视频,这个体验碾压独立工具。

  • 头像
    CHill_77
    好奇一个问题:用 Vids 做的视频,版权算谁的?SynthID 可以追踪来源,但内容本身的版权归属在 Google 的服务条款里写清楚了吗,有懂哥解答一下吗?

  • 头像
    Justin_LopezZ38
    免费额度用完就收费,套路一如既往。

  • 头像
    RogerThompson_X
    拿手机拍的素材扔进去,说「把背景换成海滩」,效果居然还行!虽然仔细看边缘有点穿模,但对于快速出片来说已经够用了。不用开 Final Cut 就能搞定简单后期,这一条已经值回订阅费了。

  • 头像
    Robert.Hill168406
    大家觉得 Vids 加 Omni 有没有可能替代掉企业内部大部分视频外包需求?我们公司去年光培训视频外包就花了十几万,如果 Vids 能满足基本需求那成本能省不少。

  • 头像
    Amy_Brown_2023
    中文语音合成实在太出戏了,那股电子味怎么都去不掉。做给中国团队看的视频,一开口就拉回现实,还不如直接打字幕算了。

  • 头像
    Vincent.RogersII
    Omni 的渐进编辑是真的省时间。之前用其他 AI 视频工具改一次要重生成全部,现在只要指出哪几秒不满意就好了。做一些长视频的时候这个功能价值特别大。

  • 头像
    Helen.HowardSr
    试用发现 Omni 的台词修改能力有 bug。让一个角色改说另一句话,结果前半段说新台词后半段说旧台词,画面里嘴巴对不上,看着像精神分裂。细节控制还得再练练。