Google Vids (Omni)
Google Vids 整合 Gemini Omni 多模態模型,支援文字與圖片生成影片、對話式編輯和個人 AI 化身功能,讓企業使用者無需專業剪輯技能即可製作高質量影片
深度報告
-
2026 年 7 月,Google 為旗下的 AI 影片創作工具 Vids 注入了兩項重大更新——Gemini Omni 多模態影片模型和個人 AI 化身功能,使 Vids 從一個輔助辦公的演示工具一躍成為「全能型 AI 影片工作室」。Gemini Omni 支援文字+圖片混合輸入生成影片、對話式逐步編輯、物理世界理解等突破效能力;個人化身功能則讓使用者上傳一張自拍和一段語音就能生成數字分身,「主演」自己的影片。這兩項更新不僅拉高了 AI 影片生成的技術天花板,也在企業市場中直接挑戰 Synthesia、HeyGen 等獨立新創的定位。
-
Google Vids 最早於 2025 年作為 Google Workspace 的全新應用推出,定位是企業內部影片製作輔助工具。在初期階段,使用者可以在 Vids 中撰寫指令碼、選擇模板、搭配背景音樂,生成簡單的講解式影片。2026 年 2 月,Google 將 Veo 3.1 模型整合進 Vids,讓使用者能夠直接透過文字生成影片片段,初步建立了 AI 影片生成的能力基座。 但真正的分水嶺出現在 2026 年 5 月的 Google I/O 大會上。Google DeepMind 釋出了一款全新的多模態模型——Gemini Omni,它並非 Veo 系列的迭代升級,而是一個「從地基重新設計」的新物種(Google DeepMind 產品負責人 Nicole Brichtova 在訪談中用了「step change」來形容這種跨越)——它的訓練目標從第一天起就是「多模態進、多模態出」,影象、音訊、影片、文字不是訓練時的附加條件,而是模型理解世界的原始資料。這一架構上的根本性差異,讓 Omni 在影片編輯、風格遷移、場景續寫等任務上展現出「湧現」能力——即模型能做的事情超出了訓練資料中顯式出現過的場景。 2026 年 7 月 16 日,Gemini Omni 正式進入 Google Vids,成為產品歷史上規模最大的一次更新。同時釋出的還有個人 AI 化身功能,此前該功能已經在美國向所有 Google 賬戶持有人免費開放測試。根據 Google 官方資料,Vids 目前月活躍使用者已超過 700 萬。
-
文字+圖片混合生成。Gemini Omni 在 Vids 中的核心能力是「多模態影片生成」。使用者不僅可以用自然語言描述想要的畫面,還可以同時上傳參考圖片(比如一張產品照片甚至隨手畫的草圖),模型會將文字與視覺資訊融合,生成與使用者腦海中的畫面更接近的影片。這和傳統 AI 影片工具「只認提示詞」的工作方式有本質區別——使用者不再需要苦思冥想地寫 prompt,用一張照片就能解決「千言萬語說不清」的問題。 對話式編輯。這可能是 Omni 提升體驗最明顯的地方。過去 AI 生成的影片如果不滿意,通常只能刪掉重來。Omni 支援增量式、對話式的影片編輯:使用者可以說「把背景換成海灘」「把光線調亮」「在結尾加一個淡出效果」,模型會只修改指定的片段,而其他保持稽核透過的內容不變。這種「逐幀可調」的體驗讓 AI 影片製作流程更接近傳統的非線性剪輯,而不是反覆生成整個片段賭運氣。更值得注意的一點是,Omni 同樣可以編輯使用者自己用手機拍攝的影片——換背景、調色、去噪,全在對話方塊裡用文字完成。 漸進式編輯(Progressive Editing)。傳統的 AI 影片工作流中,如果使用者對畫面某一幀不滿意,修改文字描述後通常需要從頭重新生成整段影片,浪費時間且每次生成的結果也不一致。Omni 的漸進編輯只重新生成使用者不滿意的幾秒畫面,已透過的片段保持不變。這種能力大幅提升了創作效率和迭代靈活性。 物理世界理解與複雜概念視覺化。根據 Google DeepMind 的說法,Omni 在訓練時融入了對重力、動能、流體力學等物理規則的學習,結合 Gemini 模型本身的歷史、科學和文化知識,實現了從「畫得真」到「講好故事」的跨越。實測中,Omni 可以生成彈珠在連鎖軌道上運動的物理模擬場景,也能將蒙娜麗莎從畫作縮放到顏料分子再到原子級別的講解式影片。中文媒體的實測也顯示,Omni 能理解「玄武門對掏」這樣充滿中式文化梗的提示詞,雖然細節上仍有瑕疵(中文口音不夠自然、偶有物理穿模),但從理解力來看,Omni 確實跨出了 AI 影片工具的重要一步——它不再只是「生成畫面」,而是在「模擬世界」。 個人 AI 化身。功能流程極其簡單:上傳一張自拍照→錄製一段簡短語音樣本→輸入想說的文字指令碼→AI 用你的臉和聲音朗讀出來。Google 使用了多角度面孔採集和朗讀隨機數字錄音的安全驗證流程,化身嚴格繫結賬戶持有人的 Google 賬號,不可冒用他人形象。化身控制方面,Vids 還提供了 Steering Tags 功能,使用者可以在指令碼文字中嵌入 [excitedly] [warmly] 等方括號指令來控制情感語調和節奏,甚至可以指揮化身在畫面中行走、說話或操作物件。 SynthID 數字水印。所有 AI 生成的影片片段都會嵌入 DeepMind 開發的 SynthID 不可見數字水印,同時支援 C2PA 跨平臺後設資料,即使影片被剪輯搬運壓縮,水印依然可以追蹤溯源。
-
Gemini Omni 和個人化身功能面向 Google AI Pro 和 Ultra 訂閱使用者以及 Google Workspace 商業客戶提供。沒有無限額度方案,AI 化身每月約 25 次生成額度,影片片段約 50 次,額度每月初重置:Google Workspace 商業版:月費制,內建 25 次化身額度 + 50 影片片段額度Google AI Pro:月費制,額度同上Google AI Ultra:月費制,額度同上美國個人賬戶(免費試用):有限額度個人化身功能目前僅限 18 歲以上使用者在特定地區使用,歐洲經濟區、英國、瑞士暫不支援。Google 的策略不是靠 Vids 直接收費,而是將其作為 Workspace 生態的增值能力來提升套件整體價值和使用者黏性——這是一種典型的「生態競爭」路徑。
-
正面評價集中在易用性和整合度。Android Authority 的評測認為,Google Vids 配合 Gemini Omni 讓「影片編輯終於變得不用學就會了」。使用者普遍對自然語言編輯的體驗給予肯定——「更換背景」「調整光線」這些在傳統剪輯軟體中需要多步驟操作的事情,現在一句話就能完成。個人化身功能尤其受到企業內部培訓團隊和市場營銷人員的歡迎,他們可以不用架設攝影棚就製作出有真人出鏡的產品演示和培訓影片。 負面反饋集中在精細控制不足和地區限制。中文媒體的實測文章指出,Omni 在中文語音合成上還存在口音不自然的問題,對於較為複雜的臺詞修改指令,模型有時候會「聽不懂」,出現新臺詞覆蓋不全或口型與聲音不匹配的情況。此外,物理模擬在某些場景下仍有輕微的穿模和失真。個人化身的地區限制也是一個高頻吐槽點——EEA、英國等區域的使用者目前無法使用化身功能。還有一些使用者認為每月 25 次化身生成額度偏低,對於高頻製作場景來說不夠用。
-
行業分析師普遍認為,Gemini Omni 是 AI 影片領域繼 OpenAI Sora 之後的又一次「正規化級躍遷」。TechCrunch 的評價很具代表性——「Google 正在把 AI 化身生成從獨立新創市場拖進預設的 Workspace 工具箱」。這意味著 Synthesia 和 HeyGen 等獨立 AI 影片平臺的競爭格局正在被改寫:Google Vids 原生整合在 Google Workspace 中,使用者在 Docs 裡寫好的指令碼可以直接拖進 Vids 生成影片,組織架構、許可權管理、協作流程全在一套系統裡閉環。對於已經使用 Google Workspace 的數億企業使用者來說,這種「零摩擦」的整合體驗是獨立工具難以複製的。 太平洋科技等中文媒體將 Gemini Omni 比作「影片界的 Nano Banana 時刻」,認為其意義不僅在於影片生成能力,更在於 Google 展示了一條從「預測文字」到「模擬現實」的技術路線。而 a16z 投資人 Justine Moore 則強調,Omni 的對話式編輯和數字分身是兩個讓它從競品中脫穎而出的關鍵特性。 但也有分析指出,Google 在 AI 影片領域並非沒有挑戰——Omni 在影片畫質和一致性上尚未全面超越 Sora 的最新一代模型,且 Vids 作為企業辦公工具的產品定位,決定了它不太可能成為專業影視創作者的優先選擇。
-
數字身份的安全隱患是最大的灰色地帶。雖然 Google 設定了活體驗證、賬戶繫結、年齡限制等防護措施,但數字人技術一旦開放,必然會被用於製作虛假資訊內容。Google 透過 SynthID 水印提供追溯能力,但水印是否能經得起專業攻擊者的對抗性測試,目前仍是一個開放問題。 地區合規風險也值得注意。個人化身功能目前不支援歐洲經濟區、英國等市場,這與 GDPR 等隱私法規中對生物特徵資料採集和處理的嚴格要求直接相關。對於中國市場,Google Workspace 本身無法直接訪問,因此 Vids 的功能不會直接影響國內使用者,但 SynthID 的水印策略和數字人安全規範對國內 AI 影片行業有參考價值。 AI 生成內容的可靠性問題。中文媒體的實測發現,Omni 在細節上有一些明顯 bug——物理模擬中偶有穿模和「球體分裂」等不符合現實的結果,中文語音合成仍有明顯的電子感。這些瑕疵在普通使用者友好的宣傳影片中可能被放大,影響使用者對 AI 影片工具體驗的信任度。 對獨立新創的擠壓。Synthesia 和 HeyGen 等新創公司依靠 AI 影片工具在近幾年快速成長,HeyGen 在 2026 年已實現年化收入突破 2 億美元。Google 的入局意味著這些公司不僅要面對巨頭的技術競爭,還可能失去透過 Google Workspace 生態觸達企業的渠道優勢。長期來看,AI 影片工具的獨立市場空間可能被擠壓,企業級使用者可能會更傾向於選擇「全家桶」方案。
-
適合:企業內部培訓部門、市場營銷團隊、銷售團隊等需要高頻製作影片內容但缺乏專業剪輯能力的機構使用者;已經使用 Google Workspace 的企業,Vids 的整合體驗遠超獨立工具;需要快速製作產品演示、團隊溝通、教學影片的個人創作者。 不適合:追求電影級畫質的專業影視製作人;需要在歐洲經濟區或英國使用個人化身功能的使用者;需要無限量、高頻次生成影片的生產團隊(額度的月度限制可能成為瓶頸)。 替代方案:Synthesia(企業培訓影片領域市場份額領先)、HeyGen(年收入已破 2 億美元、支援更廣泛的語言和數字人風格)、D-ID(在 AI 數字人互動場景有差異化優勢)、剪映專業版/即夢(面向中文使用者的本地化 AI 影片工具)。
-
Google Vids 加上 Gemini Omni,讓 AI 影片創作的走向從「一個人打字的獨角戲」變成了「全公司能協作的低門檻方案」。Omni 從地基重新設計的多模態架構讓它具備了對話式編輯和物理理解等突破效能力,而個人化身功能則在合規和安全之間取得了一定的平衡。對企業使用者來說,如果已經在用 Google Workspace,Vids 現在可能是起步成本最低的 AI 影片方案之一——它不完美(中文語音還有進步空間、額度有限、部分地區沒有化身功能),但方向是對的。Google 正在把「人人能拍影片」這件事從口號變成產品。
使用者評論
-
WestonKristensen—用 Vids 做了個部門季度彙報影片,以前找設計外包要等一週,現在自己打字加幾張截圖,十分鐘搞定初版。對話式編輯確實好用,說「換個深色背景」它就換了,不用學剪輯真的爽。 -
Pglar—用分身給女朋友發了段生日祝福,她竟然沒發現是AI!這技術藏不住了。 -
xEmiliaKoski_x—官方演示裡那個「玄武門對掏」的影片我看了,笑死。雖然理解了中國梗,但倆唐代人物說中文那個口音也太奇怪了,感覺像在聽AI念課文。 -
JoseAlvarez_7—有沒有人對比過 Vids 的化身和 Synthesia 的?我用 Synthesia 一年了,就數字人的自然度來說,Vids 的好處是跟 Workspace 整合深,但 Synthesia 的語言和多風格支援更廣,各有所長吧。 -
AmandaNelsonIII—會打字就能剪影片的時代來了。 -
Teresa_Mitchell_2022—請問 Vids 裡的 Omni 生成的影片可以商用嗎?想用在公司官網首頁的產品宣傳上,不知道有沒有什麼限制。 -
Phillip.RobinsonQ—最煩的是地區限制。我在英國出差,想試試個人分身功能,直接提示不支援。都 2026 年了還得看地區分批開放,Google 什麼時候才能全球同步上? -
Amber_Garcia_99—我們人事部試了個人分身功能,錄了段入職培訓影片。上傳自拍加讀一串數字,生成的數字人說話口型居然對得上。不過額度有點少,一個月25次分身額度做個系列培訓就不夠用了。 -
Gregory_Mitchell_2021—分享個小技巧:想讓化身的情感自然一些,可以在指令碼里加 Steering Tags,比如 [excitedly] 或者 [warmly],生成的語調會有明顯變化。不需要手動加的話,下一步還有個自動標籤的選項可以一鍵搞定。 -
Jean_Foster_2020—用了三天 Vids,回不去了。 -
GCooper007559—做教學影片的最佳搭檔,沒有之一。 -
MsAnthonyHarcourt_dev—要做產品 Demo 影片的話,建議先用 Google Slides 做好逐頁稿,再匯入 Vids 轉成影片框架,比直接在 Vids 裡從頭寫指令碼效率高一倍。 -
梁海剛—試了試 Omni 的文字加圖片混合生成,給了張產品草圖加一段描述,出來的效果比我預期的要好很多,居然把我的草圖裡的細節都還原了。這個比純文字 prompt 靠譜太多。 -
Sarah_Bell168405—額度是真的少,AI 化身一個月 25 次,影片片段 50 次。我做了兩個影片就用了大半額度,月中就卡住了。這不就是逼人買更貴的方案嗎。 -
RoyAlvarez007—限地區、限年齡、限額度的產品真的很勸退。 -
LButlerQ48—合成的那個走路姿勢也太假了吧,根本沒法用。 -
Dylan_FisherX—我現在用 Workspace Business Standard,查了一下好像沒有包含 AI 化身功能。是要額外買 AI 附加包才能用嗎,還是有哪個套餐是自帶這個的? -
JohnnyTorres369—有人試過中文輸入的編輯效果嗎?比如說「把背景換成竹林」,它理解得了嗎? -
海角_14—Omni 物理理解確實進步了,但也沒官方吹的那麼神。生成彈珠軌道那個測試,後半段一個小球突然變兩個,這種 bug 放在正式版裡不應該吧。 -
yellowmouse158—團隊內部試用了 Google Vids 做客戶 Demo 影片,對我來說最大的價值是協作。之前用 HeyGen 做影片,改一版發來發去非常麻煩。Vids 直接在 Workspace 裡共享,像改文件一樣改影片,這個體驗碾壓獨立工具。 -
CHill_77—好奇一個問題:用 Vids 做的影片,版權算誰的?SynthID 可以追蹤來源,但內容本身的版權歸屬在 Google 的服務條款裡寫清楚了嗎,有懂哥解答一下嗎? -
Justin_LopezZ38—免費額度用完就收費,套路一如既往。 -
RogerThompson_X—拿手機拍的素材扔進去,說「把背景換成海灘」,效果居然還行!雖然仔細看邊緣有點穿模,但對於快速出片來說已經夠用了。不用開 Final Cut 就能搞定簡單後期,這一條已經值回訂閱費了。 -
Robert.Hill168406—大家覺得 Vids 加 Omni 有沒有可能替代掉企業內部大部分影片外包需求?我們公司去年光培訓影片外包就花了十幾萬,如果 Vids 能滿足基本需求那成本能省不少。 -
Amy_Brown_2023—中文語音合成實在太出戏了,那股電子味怎麼都去不掉。做給中國團隊看的影片,一開口就拉回現實,還不如直接打字幕算了。 -
Vincent.RogersII—Omni 的漸進編輯是真的省時間。之前用其他 AI 影片工具改一次要重生成全部,現在只要指出哪幾秒不滿意就好了。做一些長影片的時候這個功能價值特別大。 -
Helen.HowardSr—試用發現 Omni 的臺詞修改能力有 bug。讓一個角色改說另一句話,結果前半段說新臺詞後半段說舊臺詞,畫面裡嘴巴對不上,看著像精神分裂。細節控制還得再練練。