Gemini Omni Flash

Google DeepMind 的任意模態輸入、帶對話式剪輯的原生多模態影片生成模型

深度報告

  • Gemini Omni Flash 是 Google DeepMind 在「Omni」模型家族推出的首款產品,於 2026 年 5 月 19 日 Google I/O 2026 上釋出。它把 Gemini 的推理能力與原生多模態生成結合起來,能接受文字、圖片、音訊、影片任意組合作為輸入,輸出帶同步原生音訊的 720p 影片。真正讓它從一眾文生影片工具裡脫穎而出的,是「對話式多輪剪輯」——你用自然語言一句句改,畫面裡的角色、光影、場景記憶會連貫保留。它已透過 Gemini App、Google Flow、YouTube Shorts 觸達消費者,也在 2026 年 6 月 30 日開放了開發者公測 API。

  • Omni 是 Google 在把 Gemini 做成「徹底原生多模態」路上的關鍵一步。官方說法是「create anything from any input, starting with video」,影片只是第一個落地的輸出形態,未來會擴充套件到影象、音訊等任意模態。家族定位上,Omni Flash 是輕量、快、便宜的檔位,對標的是自家 Veo 3.1 Fast,而非旗艦 Veo 3.1;路線圖裡明顯還留著能力更強的 Omni Pro。模型由 Google TPU 訓練,採用 JAX 與 ML Pathways,架構是基於 transformer 的原生多模態模型。 釋出節奏上,5 月 19 日消費者版隨 Gemini App、YouTube 鋪開,6 月 30 日開發者公測 API(模型 ID 為 gemini-omni-flash-preview)透過 Gemini API、Google AI Studio 與 Vertex AI 上線。DeepMind 在 7 月 5 日前後公開了官方 model card,但至今未公佈任何正式評測分數,把基準留到了面向開發者和企業客戶開放 API 之後。

  • 核心玩法是「any-to-any」:一次推理裡把文字提示、參考圖(最多約 7 張)、一段影片、一段音訊混在一起,統一理解後產出連貫影片。當前輸出為 3 到 10 秒的 720p、24fps 片段,支援 16:9、9:16、1:1 比例,而且音訊不是後期合成,是和畫面同一 pass 原生生成的,口播、音效、BGM 天然同步。 最值得說的能力是對話式剪輯,跑在 Interactions API 上。它靠一個 previous_interaction_id 欄位把上一輪結果掛到下一輪,你不用重新上傳影片,說「把背景換成暖光廚房」「人物別動、鏡頭推近一點」,模型會保留你不想動的部分、只改你點名的區域性。這把「剪輯」從拖關鍵幀時間線變成了一場聊天,是它相對 Runway、Pika、Kling 這類工具最大的差異點。Google 還順手做了三個可 remix 的演示 App(Anywhere、Space Lift、Omni Product Studio),演示「先用 Nano Banana 2 Lite 出靜幀、再交給 Omni Flash 動起來」的影象到影片流水線。每段影片都帶不可見的 SynthID 數字水印,可在 Gemini App、Chrome 與 Search 裡驗證。

  • 消費側,Gemini Omni Flash 對 Google AI Plus、Pro、Ultra 訂閱使用者免費開放(走 Gemini App 與 Google Flow),YouTube Shorts 與 YouTube Create 對 18 歲以上使用者也免費。Google 在 2026 年 6 月把 AI Plus 月費從 7.99 美元砍到 4.99 美元,Pro 維持 19.99 美元,Ultra 分 100 與 200 美元兩檔;Flow 每月積分池 Plus 200、Pro 1000、Ultra 10000 到 25000。 開發者 API 沒有免費檔,按影片秒數計費:720p 約 0.10 美元/秒,換算成 token 是影片輸出 17.50 美元/百萬 token、輸入(文字/圖/音/視)1.50 美元/百萬 token,每秒 720p 約 5792 個輸出 token。一個 8 秒片段含輸入大概 0.85 美元。在 Google Flow 裡,Omni Flash 單次生成消耗積分 4s=15、6s=20、8s=25、10s=30,剪輯上傳影片統一 40 積分。API 入口只有 AI Studio 與 Vertex AI 兩條官方通道,兩者 SDK 與鑑權體系互不通用,企業部署要預留 30 到 60 分鐘上手成本。

  • 上手過的創作者普遍把驚喜點放在「編輯迴圈」而非「畫質」。在 Gemini App 裡用自然語言改鏡頭、換背景、加物體,角色一致性保持得相當好;有測評連續兩輪編輯,同一件紅羽絨服、同一張臉、同一頭髮的細節都乾淨地延續到了不同打光的新場景裡。把已有素材丟進去、說人話改、改到滿意,這個工作流被認為明顯優於「不滿意就整段重 roll」。 負面反饋集中在幾個地方。一是配額與限制:社群裡不少人吐槽生成次數和時長卡得很緊,有人反映僅生成 5 個影片就耗盡配額,連帶 Pro、Flash 模式都用不了。二是一處失誤的編輯也會消耗一次生成額度,認真測試很容易比預期燒更快。三是安全過濾偏嚴、部分瀏覽器或手機上出現過影片卡死無法播放的可用性 bug。

  • 第三方 Arena 盲測裡,Omni Flash 文字生影片拿到 1527 Elo 居首,圖生影片 1475 與位元組 Seedance 2.0 並列第一,確實把天花板頂高了。但 Google 自己始終沒釋出官方基準,所以「數值領先」目前主要靠社群盲測支撐,媒體對此普遍持保留態度。 行業裡更清醒的判斷是:Omni Flash 是「快、便宜的影片檔」,不是 Google 最好的影片模型。重度的 AI 影片使用者同臺對比後,認為它在複雜運動、打鬥、物理一致性上仍落後於 Seedance 2.0——Jenga 磚塊會憑空消失或變形、滾珠在轉折處無故彈起,物理更像是「觀感上的合理」而非嚴格解算。它的價值不在「從零生成最漂亮的一鏡」,而在「基於已有片段做可控迭代」這條工作流上。

  • 首當其衝的是深偽與內容可信度。因為模型能生成近乎真實攝像機的影片,SynthID 這類 AI 標識成了剛需,討論也很快延伸到影視工業、VFX、previs 乃至機器人模擬領域,它是創作工具還是進一步汙染影片生態,兩極分化。 地域與合規限制也值得注意:官方文件寫明,上傳影片的剪輯功能在歐盟經濟區、瑞士、英國不可用,部分美國州也被排除;含未成年人的圖片在上述地區禁止上傳。企業訪問另有規則,個人賬號需有 Google AI 套餐,工作或學校賬號需符合條件的 Workspace 授權,釋出視窗期大量企業使用者因此被鎖在門外。 還有一類風險是山寨與混淆。市面上不存在官方 APK、登入門戶或桌面客戶端,「gemini omni apk」「下載」一類搜尋會指向 squat 站點,截至 2026 年 7 月初至少已有一個非官方域名排在模型名搜尋首頁。另外模型 card 自曝的三處已知短板——多步編輯的一致性、複雜運動場景、畫面內準確文字——尚未解決,中文、日文等文字渲染尤其弱。

  • 如果你要的是基於一段已有影片改環境、改機位、改風格、保留主體不動,Omni Flash 是目前最順手的選項,尤其適合短影片、產品演示、科普講解這類「一個場景一個意思快速落地」的活。它和 Nano Banana 2 Lite 串起來做「先出靜幀、再動起來」的流水線體驗很好。 如果你追求從零生成最驚豔的一鏡、強運動畫質或長敘事,Seedance 2.0、Kling 3.0、Veo 3.1 在不少風格上仍更穩。做產品、SaaS 或生產管道、想接後端 API 的團隊,目前只能等 Gemini API / Vertex AI 的公測通道成熟,沒有官方支援的整合路徑。建議重度創作者先選 Ultra 檔再上量,並預留「失誤也扣額度」的試錯成本。

  • Gemini Omni Flash 未必是畫質天花板,但它把影片生成從「寫提示詞、等結果、不滿意重來」推進到「扔素材進去、說人話改、改到滿意」,這個方向是對的,也確實打到了創作者的痛點。Flash 更像前菜,等 Omni Pro 與影象、音訊輸出補齊後,Omni 家族代表的正規化轉變才會真正展開。

使用者評論

  • 頭像
    KarenLongK
    回不去了,剪輯流程被它改寫了。

  • 頭像
    JJones007
    生成質量可用、好看,但別指望它一次出長片,拆段拼吧。

  • 頭像
    OMitchellQ5
    API 沒有免費檔,0.10 美元一秒,8 秒片段差不多一塊錢,開發者得上 AI Studio 或 Vertex。

  • 頭像
    JJimenezJr
    免費的!YouTube Shorts 直接玩。

  • 頭像
    Ann.GutierrezX
    歐盟和英國不能編輯上傳的影片,含未成年人的圖也禁傳,地區限制挺煩。

  • 頭像
    LydiaThomas_202318
    Nano Banana 的親弟弟,影片版。

  • 頭像
    silverzebra287
    開頭那段小提琴手三連編輯是真驚豔——從舞臺到街景再到過肩鏡頭,同一個人、同一把琴、姿勢都沒變。但多輪之後一致性會開始漂移,有測評跑了 22 條提示也得出類似結論:短片段迭代強,長敘事、密集文字、反覆大改還撐不住。別拿它當專業剪輯軟體用。

  • 頭像
    LaurenJames
    和 Seedance 2.0 同臺對比了一下,結論很現實:從零生成最漂亮的一鏡,Seedance 更穩;但你要基於已有素材改背景、改機位、換風格,Omni Flash 的對話式編輯是獨一檔。打鬥場景還是 Seedance 完勝,Omni 的武術動作偏慢、水花也糊。所以別神話它,定位清楚就行。

  • 頭像
    AdamMadsen
    用了一週最深的感受是,Omni Flash 把「改影片」變成了一場聊天。我上傳一段街拍,說「把背景換成海邊夕陽、鏡頭推近」,它真就改了,人物還保持得住。但指令必須寫得很精確,我有次漏了「暖光角度」,它直接從夕陽跳到深夜,體驗像開一臺脾氣倔的跑車——爽是爽,路況得自己摸透。

  • 頭像
    syrl3e
    在 Google Flow 裡用比 Gemini App 正式得多。Flow 是專案工作臺,能上傳參考影片、裁切片段、確認素材使用權再生成,適合持續迭代;App 入口更像輕量測試區,次數和可用性受地區訂閱影響。做商業專案的記得留意那個素材使用權提示,版權邊界要提前確認。

  • 頭像
    Janet.Turner_Pro
    重度創作者小心額度。Google 把按天訊息數改成了按算力消耗,Omni 影片特別吃配額,密集用一兩個小時就觸發五小時冷卻。好訊息是後來緊急鬆綁了,失敗的請求不再扣額度,還加了用量儀表板和隨用隨付的 AI 點數。但免費檔基本只能 YouTube Shorts 嚐鮮。

  • 頭像
    Amber.Scott36947
    物理一致性還是會翻車,滾珠在轉折處無故彈起,Jenga 磚塊還能憑空消失,說是世界模型其實是觀感上的合理,不是真在解方程。

  • 頭像
    DylanMurray369
    配音和旁白同步偶爾慢半拍,一個模型塞太多功能,音樂和口播這塊不如專用模型鋒利。

  • 頭像
    TIkra
    Omni Flash 的對話式剪輯真的回不去了。

  • 頭像
    DebraRodriguez27
    Arena 盲測裡文字生影片拿到 1527 Elo 排第一,圖生影片 1475 跟 Seedance 2.0 並列第一,這個成績確實把天花板頂高了,但 Google 自己一直沒發官方基準,所以領先目前主要靠社群盲測撐著。

  • 頭像
    Lisa_Powell369
    畫面銳利度沒問題,但讀起來偏數字感、不夠電影味,fast motion 還是會崩一點。

  • 頭像
    Jean_Baker369
    SynthID 水印是隱形的,能在 Gemini App 和 Chrome 裡查是不是 AI 生成的,深偽這塊起碼有標識。

  • 頭像
    JMendozaII
    Wharton 的 Ethan Mollick 用「海獺、精神航空、莎士比亞打披薩機器人」這種複雜提示測,轉場順、指令遵循高,他自己說真正聰明的模型能直接吃影片、創作空間大得多,這點我是認可的。

  • 頭像
    孔昊
    生成一條短影片消耗我 Pro 配額的三分之一,改一次又要一半,真不夠造。

  • 頭像
    墨染255
    真人臉直接糊成一團,只能拿背影湊數,這安全機制也太保守了。

  • 頭像
    Adam.Stewart_668
    10 秒上限反而適合做短內容,拆成幾段快速試不同開場挺順。

  • 頭像
    SThompson_Plus
    失敗一次就把五小時額度燒光,這 bug 當時坑慘一堆人,後來 Google 修了。

  • 頭像
    Michelle.ThompsonZ
    它還會自動加分鏡,我沒寫要 cutscene 它也把節奏切出來了,短片很實用。

  • 頭像
    PRper
    AI Plus 現在 4.99 美元一個月,比之前便宜,入門門檻低了。