Google Vids (Omni)

Google Vids 整合 Gemini Omni 多模态模型,支持文字与图片生成视频、对话式编辑和个人 AI 化身功能,让企业用户无需专业剪辑技能即可制作高质量视频

In-depth Report

  • 2026 年 7 月,Google 为旗下的 AI 视频创作工具 Vids 注入了两项重大更新——Gemini Omni 多模态视频模型和个人 AI 化身功能,使 Vids 从一个辅助办公的演示工具一跃成为「全能型 AI 视频工作室」。Gemini Omni 支持文字+图片混合输入生成视频、对话式逐步编辑、物理世界理解等突破性能力;个人化身功能则让用户上传一张自拍和一段语音就能生成数字分身,「主演」自己的视频。这两项更新不仅拉高了 AI 视频生成的技术天花板,也在企业市场中直接挑战 Synthesia、HeyGen 等独立新创的定位。

  • Google Vids 最早于 2025 年作为 Google Workspace 的全新应用推出,定位是企业内部视频制作辅助工具。在初期阶段,用户可以在 Vids 中撰写脚本、选择模板、搭配背景音乐,生成简单的讲解式视频。2026 年 2 月,Google 将 Veo 3.1 模型整合进 Vids,让用户能够直接通过文本生成视频片段,初步建立了 AI 视频生成的能力基座。 但真正的分水岭出现在 2026 年 5 月的 Google I/O 大会上。Google DeepMind 发布了一款全新的多模态模型——Gemini Omni,它并非 Veo 系列的迭代升级,而是一个「从地基重新设计」的新物种(Google DeepMind 产品负责人 Nicole Brichtova 在访谈中用了「step change」来形容这种跨越)——它的训练目标从第一天起就是「多模态进、多模态出」,图像、音频、视频、文本不是训练时的附加条件,而是模型理解世界的原始数据。这一架构上的根本性差异,让 Omni 在视频编辑、风格迁移、场景续写等任务上展现出「涌现」能力——即模型能做的事情超出了训练数据中显式出现过的场景。 2026 年 7 月 16 日,Gemini Omni 正式进入 Google Vids,成为产品历史上规模最大的一次更新。同时发布的还有个人 AI 化身功能,此前该功能已经在美国向所有 Google 账户持有人免费开放测试。根据 Google 官方数据,Vids 目前月活跃用户已超过 700 万。

  • 文字+图片混合生成。Gemini Omni 在 Vids 中的核心能力是「多模态视频生成」。用户不仅可以用自然语言描述想要的画面,还可以同时上传参考图片(比如一张产品照片甚至随手画的草图),模型会将文字与视觉信息融合,生成与用户脑海中的画面更接近的视频。这和传统 AI 视频工具「只认提示词」的工作方式有本质区别——用户不再需要苦思冥想地写 prompt,用一张照片就能解决「千言万语说不清」的问题。 对话式编辑。这可能是 Omni 提升体验最明显的地方。过去 AI 生成的视频如果不满意,通常只能删掉重来。Omni 支持增量式、对话式的视频编辑:用户可以说「把背景换成海滩」「把光线调亮」「在结尾加一个淡出效果」,模型会只修改指定的片段,而其他保持审核通过的内容不变。这种「逐帧可调」的体验让 AI 视频制作流程更接近传统的非线性剪辑,而不是反复生成整个片段赌运气。更值得注意的一点是,Omni 同样可以编辑用户自己用手机拍摄的视频——换背景、调色、去噪,全在对话框里用文字完成。 渐进式编辑(Progressive Editing)。传统的 AI 视频工作流中,如果用户对画面某一帧不满意,修改文字描述后通常需要从头重新生成整段视频,浪费时间且每次生成的结果也不一致。Omni 的渐进编辑只重新生成用户不满意的几秒画面,已通过的片段保持不变。这种能力大幅提升了创作效率和迭代灵活性。 物理世界理解与复杂概念可视化。根据 Google DeepMind 的说法,Omni 在训练时融入了对重力、动能、流体力学等物理规则的学习,结合 Gemini 模型本身的历史、科学和文化知识,实现了从「画得真」到「讲好故事」的跨越。实测中,Omni 可以生成弹珠在连锁轨道上运动的物理模拟场景,也能将蒙娜丽莎从画作缩放到颜料分子再到原子级别的讲解式视频。中文媒体的实测也显示,Omni 能理解「玄武门对掏」这样充满中式文化梗的提示词,虽然细节上仍有瑕疵(中文口音不够自然、偶有物理穿模),但从理解力来看,Omni 确实跨出了 AI 视频工具的重要一步——它不再只是「生成画面」,而是在「模拟世界」。 个人 AI 化身。功能流程极其简单:上传一张自拍照→录制一段简短语音样本→输入想说的文字脚本→AI 用你的脸和声音朗读出来。Google 使用了多角度面孔采集和朗读随机数字录音的安全验证流程,化身严格绑定账户持有人的 Google 账号,不可冒用他人形象。化身控制方面,Vids 还提供了 Steering Tags 功能,用户可以在脚本文本中嵌入 [excitedly] [warmly] 等方括号指令来控制情感语调和节奏,甚至可以指挥化身在画面中行走、说话或操作物件。 SynthID 数字水印。所有 AI 生成的视频片段都会嵌入 DeepMind 开发的 SynthID 不可见数字水印,同时支持 C2PA 跨平台元数据,即使视频被剪辑搬运压缩,水印依然可以追踪溯源。

  • Gemini Omni 和个人化身功能面向 Google AI Pro 和 Ultra 订阅用户以及 Google Workspace 商业客户提供。没有无限额度方案,AI 化身每月约 25 次生成额度,视频片段约 50 次,额度每月初重置:Google Workspace 商业版:月费制,内置 25 次化身额度 + 50 视频片段额度Google AI Pro:月费制,额度同上Google AI Ultra:月费制,额度同上美国个人账户(免费试用):有限额度个人化身功能目前仅限 18 岁以上用户在特定地区使用,欧洲经济区、英国、瑞士暂不支持。Google 的策略不是靠 Vids 直接收费,而是将其作为 Workspace 生态的增值能力来提升套件整体价值和用户黏性——这是一种典型的「生态竞争」路径。

  • 正面评价集中在易用性和整合度。Android Authority 的评测认为,Google Vids 配合 Gemini Omni 让「视频编辑终于变得不用学就会了」。用户普遍对自然语言编辑的体验给予肯定——「更换背景」「调整光线」这些在传统剪辑软件中需要多步骤操作的事情,现在一句话就能完成。个人化身功能尤其受到企业内部培训团队和市场营销人员的欢迎,他们可以不用架设摄影棚就制作出有真人出镜的产品演示和培训视频。 负面反馈集中在精细控制不足和地区限制。中文媒体的实测文章指出,Omni 在中文语音合成上还存在口音不自然的问题,对于较为复杂的台词修改指令,模型有时候会「听不懂」,出现新台词覆盖不全或口型与声音不匹配的情况。此外,物理模拟在某些场景下仍有轻微的穿模和失真。个人化身的地区限制也是一个高频吐槽点——EEA、英国等区域的用户目前无法使用化身功能。还有一些用户认为每月 25 次化身生成额度偏低,对于高频制作场景来说不够用。

  • 行业分析师普遍认为,Gemini Omni 是 AI 视频领域继 OpenAI Sora 之后的又一次「范式级跃迁」。TechCrunch 的评价很具代表性——「Google 正在把 AI 化身生成从独立新创市场拖进预设的 Workspace 工具箱」。这意味着 Synthesia 和 HeyGen 等独立 AI 视频平台的竞争格局正在被改写:Google Vids 原生集成在 Google Workspace 中,用户在 Docs 里写好的脚本可以直接拖进 Vids 生成视频,组织架构、权限管理、协作流程全在一套系统里闭环。对于已经使用 Google Workspace 的数亿企业用户来说,这种「零摩擦」的整合体验是独立工具难以复制的。 太平洋科技等中文媒体将 Gemini Omni 比作「视频界的 Nano Banana 时刻」,认为其意义不仅在于视频生成能力,更在于 Google 展示了一条从「预测文本」到「模拟现实」的技术路线。而 a16z 投资人 Justine Moore 则强调,Omni 的对话式编辑和数字分身是两个让它从竞品中脱颖而出的关键特性。 但也有分析指出,Google 在 AI 视频领域并非没有挑战——Omni 在视频画质和一致性上尚未全面超越 Sora 的最新一代模型,且 Vids 作为企业办公工具的产品定位,决定了它不太可能成为专业影视创作者的优先选择。

  • 数字身份的安全隐患是最大的灰色地带。虽然 Google 设置了活体验证、账户绑定、年龄限制等防护措施,但数字人技术一旦开放,必然会被用于制作虚假信息内容。Google 通过 SynthID 水印提供追溯能力,但水印是否能经得起专业攻击者的对抗性测试,目前仍是一个开放问题。 地区合规风险也值得注意。个人化身功能目前不支持欧洲经济区、英国等市场,这与 GDPR 等隐私法规中对生物特征数据采集和处理的严格要求直接相关。对于中国市场,Google Workspace 本身无法直接访问,因此 Vids 的功能不会直接影响国内用户,但 SynthID 的水印策略和数字人安全规范对国内 AI 视频行业有参考价值。 AI 生成内容的可靠性问题。中文媒体的实测发现,Omni 在细节上有一些明显 bug——物理模拟中偶有穿模和「球体分裂」等不符合现实的结果,中文语音合成仍有明显的电子感。这些瑕疵在普通用户友好的宣传视频中可能被放大,影响用户对 AI 视频工具体验的信任度。 对独立新创的挤压。Synthesia 和 HeyGen 等新创公司依靠 AI 视频工具在近几年快速成长,HeyGen 在 2026 年已实现年化收入突破 2 亿美元。Google 的入局意味着这些公司不仅要面对巨头的技术竞争,还可能失去通过 Google Workspace 生态触达企业的渠道优势。长期来看,AI 视频工具的独立市场空间可能被挤压,企业级用户可能会更倾向于选择「全家桶」方案。

  • 适合:企业内部培训部门、市场营销团队、销售团队等需要高频制作视频内容但缺乏专业剪辑能力的机构用户;已经使用 Google Workspace 的企业,Vids 的整合体验远超独立工具;需要快速制作产品演示、团队沟通、教学视频的个人创作者。 不适合:追求电影级画质的专业影视制作人;需要在欧洲经济区或英国使用个人化身功能的用户;需要无限量、高频次生成视频的生产团队(额度的月度限制可能成为瓶颈)。 替代方案:Synthesia(企业培训视频领域市场份额领先)、HeyGen(年收入已破 2 亿美元、支持更广泛的语言和数字人风格)、D-ID(在 AI 数字人交互场景有差异化优势)、剪映专业版/即梦(面向中文用户的本地化 AI 视频工具)。

  • Google Vids 加上 Gemini Omni,让 AI 视频创作的走向从「一个人打字的独角戏」变成了「全公司能协作的低门槛方案」。Omni 从地基重新设计的多模态架构让它具备了对话式编辑和物理理解等突破性能力,而个人化身功能则在合规和安全之间取得了一定的平衡。对企业用户来说,如果已经在用 Google Workspace,Vids 现在可能是起步成本最低的 AI 视频方案之一——它不完美(中文语音还有进步空间、额度有限、部分地区没有化身功能),但方向是对的。Google 正在把「人人能拍视频」这件事从口号变成产品。

User Reviews

  • 头像
    WestonKristensen
    Used Vids for dept quarterly report video, previously design outsourceneed wait week, now type plus few screenshots, ten min first draft. Conversational editing truly useful, say 'change to dark background' it changes, no need learn editing truly satisfying.

  • 头像
    Pglar
    Used digital twin to send girlfriend birthday wishes, she didn't even notice it's AI! This tech can't be hidden.

  • 头像
    xEmiliaKoski_x
    Watched official demo video 'Xuanwu Gate duel', died laughing. Though understood Chinese meme, but two Tang-dynasty characters speaking Chinese with weird accent, feels like listening to AI read textbook.

  • 头像
    JoseAlvarez_7
    Anyone compared Vids avatar vs Synthesia? I used Synthesia a year, on digital human naturalness, Vids benefit is deep Workspace integration, but Synthesia broader language and multi-style support, each has strength.

  • 头像
    AmandaNelsonIII
    The era of editing video just by typing has arrived.

  • 头像
    Teresa_Mitchell_2022
    Can videos generated by Vids' Omni be used commercially? Want to use on company homepage product promo, don't know restrictions.

  • 头像
    Phillip.RobinsonQ
    Most annoying is regional restriction. On UK business trip, wanted try personal twin, directly prompted unsupported. Already 2026 yet still regional phased rollout, when will Google global sync?

  • 头像
    Amber_Garcia_99
    Our HR tried personal digital twin, recorded onboarding training video. Upload selfie plus read numbers, generated digital human lip-sync actually matches. But quota a bit low, 25 twin uses/month for series training insufficient.

  • 头像
    Gregory_Mitchell_2021
    Share a tip: for natural avatar emotion, add Steering Tags in script like [excitedly] or [warmly], generated tone obviously changes. If don't want manual, next step has auto-tag option one-click.

  • 头像
    Jean_Foster_2020
    Used Vids three days, can't go back.

  • 头像
    GCooper007559
    Best companion for teaching videos, none other.

  • 头像
    MsAnthonyHarcourt_dev
    For product demo video, suggest first use Google Slides for page-by-page draft, then import Vids to video framework, twice as efficient as writing script from scratch in Vids.

  • 头像
    梁海刚
    Tried Omni's text+image mixed gen, gave product sketch plus description, effect much better than expected, actually restored my sketch details. Much more reliable than pure text prompt.

  • 头像
    Sarah_Bell168405
    Quota truly low, AI avatar 25/month, video clips 50. I made two videos used most quota, stuck mid-month. Isn't this forcing buy pricier plan?

  • 头像
    RoyAlvarez007
    Region-limited, age-limited, quota-limited product truly off-putting.

  • 头像
    LButlerQ48
    That synthesized walking posture too fake, completely unusable.

  • 头像
    Dylan_FisherX
    I use Workspace Business Standard, checked seems no AI avatar feature. Need buy AI add-on separately, or which plan includes it?

  • 头像
    JohnnyTorres369
    Anyone tried Chinese-input editing effect? Like 'change background to bamboo forest', can it understand?

  • 头像
    海角_14
    Omni physics understanding indeed improved, but not as divine as official hype. Marble track test, second half one ball suddenly becomes two, such bug shouldn't be in official version.

  • 头像
    yellowmouse158
    Team internally tried Google Vids for client demo videos, biggest value for me is collaboration. Previously HeyGen, revising back-forth troublesome. Vids shares directly in Workspace, edit video like doc, this experience crushes standalone tools.

  • 头像
    CHill_77
    Curious: videos made with Vids, who owns copyright? SynthID can track source, but content copyright ownership stated clearly in Google's ToS? Any expert explain?

  • 头像
    Justin_LopezZ38
    Free quota used then charges, same trick as always.

  • 头像
    RogerThompson_X
    Threw in phone-shot footage, said 'change background to beach', effect actually okay! Though edges slightly clip on close look, for quick output enough. No need open Final Cut for simple post, this alone worth subscription.

  • 头像
    Robert.Hill168406
    Think Vids+Omni could replace most in-house video outsourcing? Our company last year training video outsourcing alone spent over 100K, if Vids meets basic needs cost saved much.

  • 头像
    Amy_Brown_2023
    Chinese TTS too immersion-breaking, that electronic tone can't be removed. For videos Chinese team watches, once it speaks pulls back to reality, better just type subtitles.

  • 头像
    Vincent.RogersII
    Omni's progressive editing truly saves time. Previously other AI video tools regen all for one edit, now just point which seconds unsatisfactory. For long videos this feature very valuable.

  • 头像
    Helen.HowardSr
    Trial found Omni's line-editing has bug. Had a character say different line, result first half new line second half old line, mouth doesn't match, looks like split personality. Detail control needs more practice.