Gemini Omni Flash

Google DeepMind 的任意模态输入、带对话式剪辑的原生多模态视频生成模型

深度报告

  • Gemini Omni Flash 是 Google DeepMind 在「Omni」模型家族推出的首款产品,于 2026 年 5 月 19 日 Google I/O 2026 上发布。它把 Gemini 的推理能力与原生多模态生成结合起来,能接受文本、图片、音频、视频任意组合作为输入,输出带同步原生音频的 720p 视频。真正让它从一众文生视频工具里脱颖而出的,是「对话式多轮剪辑」——你用自然语言一句句改,画面里的角色、光影、场景记忆会连贯保留。它已通过 Gemini App、Google Flow、YouTube Shorts 触达消费者,也在 2026 年 6 月 30 日开放了开发者公测 API。

  • Omni 是 Google 在把 Gemini 做成「彻底原生多模态」路上的关键一步。官方说法是「create anything from any input, starting with video」,视频只是第一个落地的输出形态,未来会扩展到图像、音频等任意模态。家族定位上,Omni Flash 是轻量、快、便宜的档位,对标的是自家 Veo 3.1 Fast,而非旗舰 Veo 3.1;路线图里明显还留着能力更强的 Omni Pro。模型由 Google TPU 训练,采用 JAX 与 ML Pathways,架构是基于 transformer 的原生多模态模型。 发布节奏上,5 月 19 日消费者版随 Gemini App、YouTube 铺开,6 月 30 日开发者公测 API(模型 ID 为 gemini-omni-flash-preview)通过 Gemini API、Google AI Studio 与 Vertex AI 上线。DeepMind 在 7 月 5 日前后公开了官方 model card,但至今未公布任何正式评测分数,把基准留到了面向开发者和企业客户开放 API 之后。

  • 核心玩法是「any-to-any」:一次推理里把文字提示、参考图(最多约 7 张)、一段视频、一段音频混在一起,统一理解后产出连贯视频。当前输出为 3 到 10 秒的 720p、24fps 片段,支持 16:9、9:16、1:1 比例,而且音频不是后期合成,是和画面同一 pass 原生生成的,口播、音效、BGM 天然同步。 最值得说的能力是对话式剪辑,跑在 Interactions API 上。它靠一个 previous_interaction_id 字段把上一轮结果挂到下一轮,你不用重新上传视频,说「把背景换成暖光厨房」「人物别动、镜头推近一点」,模型会保留你不想动的部分、只改你点名的局部。这把「剪辑」从拖关键帧时间线变成了一场聊天,是它相对 Runway、Pika、Kling 这类工具最大的差异点。Google 还顺手做了三个可 remix 的演示 App(Anywhere、Space Lift、Omni Product Studio),演示「先用 Nano Banana 2 Lite 出静帧、再交给 Omni Flash 动起来」的图像到视频流水线。每段视频都带不可见的 SynthID 数字水印,可在 Gemini App、Chrome 与 Search 里验证。

  • 消费侧,Gemini Omni Flash 对 Google AI Plus、Pro、Ultra 订阅用户免费开放(走 Gemini App 与 Google Flow),YouTube Shorts 与 YouTube Create 对 18 岁以上用户也免费。Google 在 2026 年 6 月把 AI Plus 月费从 7.99 美元砍到 4.99 美元,Pro 维持 19.99 美元,Ultra 分 100 与 200 美元两档;Flow 每月积分池 Plus 200、Pro 1000、Ultra 10000 到 25000。 开发者 API 没有免费档,按视频秒数计费:720p 约 0.10 美元/秒,换算成 token 是视频输出 17.50 美元/百万 token、输入(文本/图/音/视)1.50 美元/百万 token,每秒 720p 约 5792 个输出 token。一个 8 秒片段含输入大概 0.85 美元。在 Google Flow 里,Omni Flash 单次生成消耗积分 4s=15、6s=20、8s=25、10s=30,剪辑上传视频统一 40 积分。API 入口只有 AI Studio 与 Vertex AI 两条官方通道,两者 SDK 与鉴权体系互不通用,企业部署要预留 30 到 60 分钟上手成本。

  • 上手过的创作者普遍把惊喜点放在「编辑循环」而非「画质」。在 Gemini App 里用自然语言改镜头、换背景、加物体,角色一致性保持得相当好;有测评连续两轮编辑,同一件红羽绒服、同一张脸、同一头发的细节都干净地延续到了不同打光的新场景里。把已有素材丢进去、说人话改、改到满意,这个工作流被认为明显优于「不满意就整段重 roll」。 负面反馈集中在几个地方。一是配额与限制:社区里不少人吐槽生成次数和时长卡得很紧,有人反映仅生成 5 个视频就耗尽配额,连带 Pro、Flash 模式都用不了。二是一处失误的编辑也会消耗一次生成额度,认真测试很容易比预期烧更快。三是安全过滤偏严、部分浏览器或手机上出现过视频卡死无法播放的可用性 bug。

  • 第三方 Arena 盲测里,Omni Flash 文本生视频拿到 1527 Elo 居首,图生视频 1475 与字节 Seedance 2.0 并列第一,确实把天花板顶高了。但 Google 自己始终没发布官方基准,所以「数值领先」目前主要靠社区盲测支撑,媒体对此普遍持保留态度。 行业里更清醒的判断是:Omni Flash 是「快、便宜的视频档」,不是 Google 最好的视频模型。重度的 AI 视频用户同台对比后,认为它在复杂运动、打斗、物理一致性上仍落后于 Seedance 2.0——Jenga 砖块会凭空消失或变形、滚珠在转折处无故弹起,物理更像是「观感上的合理」而非严格解算。它的价值不在「从零生成最漂亮的一镜」,而在「基于已有片段做可控迭代」这条工作流上。

  • 首当其冲的是深伪与内容可信度。因为模型能生成近乎真实摄像机的视频,SynthID 这类 AI 标识成了刚需,讨论也很快延伸到影视工业、VFX、previs 乃至机器人仿真领域,它是创作工具还是进一步污染视频生态,两极分化。 地域与合规限制也值得注意:官方文档写明,上传视频的剪辑功能在欧盟经济区、瑞士、英国不可用,部分美国州也被排除;含未成年人的图片在上述地区禁止上传。企业访问另有规则,个人账号需有 Google AI 套餐,工作或学校账号需符合条件的 Workspace 授权,发布窗口期大量企业用户因此被锁在门外。 还有一类风险是山寨与混淆。市面上不存在官方 APK、登录门户或桌面客户端,「gemini omni apk」「下载」一类搜索会指向 squat 站点,截至 2026 年 7 月初至少已有一个非官方域名排在模型名搜索首页。另外模型 card 自曝的三处已知短板——多步编辑的一致性、复杂运动场景、画面内准确文字——尚未解决,中文、日文等文字渲染尤其弱。

  • 如果你要的是基于一段已有视频改环境、改机位、改风格、保留主体不动,Omni Flash 是目前最顺手的选项,尤其适合短视频、产品演示、科普讲解这类「一个场景一个意思快速落地」的活。它和 Nano Banana 2 Lite 串起来做「先出静帧、再动起来」的流水线体验很好。 如果你追求从零生成最惊艳的一镜、强运动画质或长叙事,Seedance 2.0、Kling 3.0、Veo 3.1 在不少风格上仍更稳。做产品、SaaS 或生产管道、想接后端 API 的团队,目前只能等 Gemini API / Vertex AI 的公测通道成熟,没有官方支持的集成路径。建议重度创作者先选 Ultra 档再上量,并预留「失误也扣额度」的试错成本。

  • Gemini Omni Flash 未必是画质天花板,但它把视频生成从「写提示词、等结果、不满意重来」推进到「扔素材进去、说人话改、改到满意」,这个方向是对的,也确实打到了创作者的痛点。Flash 更像前菜,等 Omni Pro 与图像、音频输出补齐后,Omni 家族代表的范式转变才会真正展开。

用户评论

  • 头像
    KarenLongK
    回不去了,剪辑流程被它改写了。

  • 头像
    JJones007
    生成质量可用、好看,但别指望它一次出长片,拆段拼吧。

  • 头像
    OMitchellQ5
    API 没有免费档,0.10 美元一秒,8 秒片段差不多一块钱,开发者得上 AI Studio 或 Vertex。

  • 头像
    JJimenezJr
    免费的!YouTube Shorts 直接玩。

  • 头像
    Ann.GutierrezX
    欧盟和英国不能编辑上传的视频,含未成年人的图也禁传,地区限制挺烦。

  • 头像
    LydiaThomas_202318
    Nano Banana 的亲弟弟,视频版。

  • 头像
    silverzebra287
    开头那段小提琴手三连编辑是真惊艳——从舞台到街景再到过肩镜头,同一个人、同一把琴、姿势都没变。但多轮之后一致性会开始漂移,有测评跑了 22 条提示也得出类似结论:短片段迭代强,长叙事、密集文字、反复大改还撑不住。别拿它当专业剪辑软件用。

  • 头像
    LaurenJames
    和 Seedance 2.0 同台对比了一下,结论很现实:从零生成最漂亮的一镜,Seedance 更稳;但你要基于已有素材改背景、改机位、换风格,Omni Flash 的对话式编辑是独一档。打斗场景还是 Seedance 完胜,Omni 的武术动作偏慢、水花也糊。所以别神话它,定位清楚就行。

  • 头像
    AdamMadsen
    用了一周最深的感受是,Omni Flash 把「改视频」变成了一场聊天。我上传一段街拍,说「把背景换成海边夕阳、镜头推近」,它真就改了,人物还保持得住。但指令必须写得很精确,我有次漏了「暖光角度」,它直接从夕阳跳到深夜,体验像开一台脾气倔的跑车——爽是爽,路况得自己摸透。

  • 头像
    syrl3e
    在 Google Flow 里用比 Gemini App 正式得多。Flow 是项目工作台,能上传参考视频、裁切片段、确认素材使用权再生成,适合持续迭代;App 入口更像轻量测试区,次数和可用性受地区订阅影响。做商业项目的记得留意那个素材使用权提示,版权边界要提前确认。

  • 头像
    Janet.Turner_Pro
    重度创作者小心额度。Google 把按天消息数改成了按算力消耗,Omni 视频特别吃配额,密集用一两个小时就触发五小时冷却。好消息是后来紧急松绑了,失败的请求不再扣额度,还加了用量仪表板和随用随付的 AI 点数。但免费档基本只能 YouTube Shorts 尝鲜。

  • 头像
    Amber.Scott36947
    物理一致性还是会翻车,滚珠在转折处无故弹起,Jenga 砖块还能凭空消失,说是世界模型其实是观感上的合理,不是真在解方程。

  • 头像
    DylanMurray369
    配音和旁白同步偶尔慢半拍,一个模型塞太多功能,音乐和口播这块不如专用模型锋利。

  • 头像
    TIkra
    Omni Flash 的对话式剪辑真的回不去了。

  • 头像
    DebraRodriguez27
    Arena 盲测里文本生视频拿到 1527 Elo 排第一,图生视频 1475 跟 Seedance 2.0 并列第一,这个成绩确实把天花板顶高了,但 Google 自己一直没发官方基准,所以领先目前主要靠社区盲测撑着。

  • 头像
    Lisa_Powell369
    画面锐利度没问题,但读起来偏数字感、不够电影味,fast motion 还是会崩一点。

  • 头像
    Jean_Baker369
    SynthID 水印是隐形的,能在 Gemini App 和 Chrome 里查是不是 AI 生成的,深伪这块起码有标识。

  • 头像
    JMendozaII
    Wharton 的 Ethan Mollick 用「海獭、精神航空、莎士比亚打披萨机器人」这种复杂提示测,转场顺、指令遵循高,他自己说真正聪明的模型能直接吃视频、创作空间大得多,这点我是认可的。

  • 头像
    孔昊
    生成一条短视频消耗我 Pro 配额的三分之一,改一次又要一半,真不够造。

  • 头像
    墨染255
    真人脸直接糊成一团,只能拿背影凑数,这安全机制也太保守了。

  • 头像
    Adam.Stewart_668
    10 秒上限反而适合做短内容,拆成几段快速试不同开场挺顺。

  • 头像
    SThompson_Plus
    失败一次就把五小时额度烧光,这 bug 当时坑惨一堆人,后来 Google 修了。

  • 头像
    Michelle.ThompsonZ
    它还会自动加分镜,我没写要 cutscene 它也把节奏切出来了,短片很实用。

  • 头像
    PRper
    AI Plus 现在 4.99 美元一个月,比之前便宜,入门门槛低了。