Google Veo

谷歌DeepMind推出的AI视频生成模型,支持文本/图像生成视频和原生音频

深度报告

  • Google Veo 是谷歌旗下 DeepMind 部门开发的最先进的 AI 视频生成模型,于 2024 年 5 月首次发布,并在 2025 年持续迭代升级。Veo 代表了当前 AI 视频生成技术的最高水平,其最新版本 Veo 3.1(2025年10月发布)引入了革命性的原生音频生成功能,标志着 AI 视频生成正式进入"音画同步时代"。该产品支持文本到视频、图像到视频等多种生成模式,具备专业的创作控制功能,目前通过 Gemini、Google Flow、Google Vids 等多平台提供服务。

  • Google Veo 诞生于谷歌在生成式 AI 领域的重要战略布局。2024 年 5 月 14 日,谷歌在美国 I/O 开发者大会上正式发布了 Veo 视频生成模型,宣称其能够根据文本或图像输入生成超过 60 秒的高质量视频。Veo 的发布标志着谷歌正式进军 AI 视频生成领域,与 OpenAI Sora 形成直接竞争。 2025 年是 Veo 快速迭代的一年。2025 年 5 月,Google I/O 2025 大会上发布 Veo 3,带来更强的物理理解能力和原生音频生成功能。2025 年 10 月 15 日,发布 Veo 3.1,增加了场景扩展、首尾帧控制等高级功能。Veo 基于谷歌强大的生成式 AI 技术栈构建,集成了 DeepMind 在强化学习和多模态模型方面的技术积累、Gemini 大语言模型的语义理解能力,以及谷歌在视频处理和音频生成领域的底层技术。

  • Veo 3.1 提供丰富的核心功能。基础生成包括文本到视频、图像到视频、文本到视频加音频三种模式。高级创作功能包括 Ingredients to Video(通过参考图像引导视频生成)、Scene Extension(片段延长为更长视频)、First and Last Frame(首尾帧之间创建流畅过渡)。编辑功能包括 Outpainting(扩展原始画面边界)、Add Object(引入新对象)、Remove Object(移除不需要的对象)。精细控制功能包括 Character Controls(角色身体、面部和声音动画)、Motion Controls(定义对象精确运动路径)、Camera Controls(控制镜头推拉摇移)。 Veo 3.1 输出规格为 1080p 和 4K 分辨率,标准视频时长 8 秒,Veo 3.1 支持最长 168 秒扩展。用户可通过 Gemini、Flow、Google Vids、Google AI Studio、Vertex AI、Gemini API 等多平台访问 Veo。 Veo 3.1 在行业基准测试中表现优异。在 MovieGenBench 文本到视频基准测试中,Veo 3.1 在整体偏好度、文本对齐和视觉质量方面均获得最高评分。图像转视频方面,VBench 基准测试证明其在整体偏好度和文本对齐方面领先。物理逼真度和音频视频同步方面均表现最优。

  • Veo 3.1 API 提供三档定价方案。Veo 3.1 Lite:720p 为 $0.05/秒,1080p 为 $0.08/秒,不支持 4K。Veo 3.1 Fast:720p 和 1080p 均为 $0.15/秒,4K 为 $0.35/秒。Veo 3.1 Pro:各分辨率均为 $0.40-$0.60/秒。

  • 用户对 Veo 的整体反馈较为积极。核心优势包括原生音频生成(业界首个实现音画同步的视频生成模型)、物理理解能力(对真实世界物理规律的理解表现出色)、提示遵循(对复杂文本提示的解析能力强)、多平台整合(与 Gemini、Google 生态系统深度整合)。改进空间包括生成时长限制(标准仍限制在 8 秒)、生成一致性(部分场景下存在主体一致性保持问题)、内容审核(存在一定概率的内容被拦截)。

  • 在与 OpenAI Sora、Runway Gen-4 等竞品的对比中,Veo 3.1 在视频质量方面表现优秀,原生音频生成功能领先,多平台生态整合优秀,但生成时长仍有局限。

  • Veo 存在一定的技术风险,包括 Deepfake 风险(高保真视频生成技术可能被滥用于制作虚假视频)、内容审核(尽管有安全过滤器,仍存在一定概率的有害内容生成风险)、就业影响(AI 视频生成可能对传统视频制作、广告行业产生冲击)。谷歌采取的安全措施包括 SynthID 水印(默认在生成的视频中添加 AI 水印)、内容检测(集成 SynthID Detector)、安全评估(对输出内容进行多层安全检查)、限制措施(阻止有害请求的执行)。

  • Veo 适用于专业视频创作者、内容创作者、企业营销团队、开发者以及 AI 爱好者。使用建议方面,入门用户建议从 Gemini 免费版开始体验;成本优化建议选择合适的分辨率;质量提升需要使用详细、具体的提示词并合理利用参考图和首尾帧功能;合规使用需要了解并遵守平台使用政策。

  • Google Veo 代表了当前 AI 视频生成技术的最高水平。2025年 Veo 3 的发布,特别是原生音频生成功能的引入,标志着 AI 视频生成正式进入"音画同步时代",这是该领域的重要里程碑。核心优势包括原生音画同步生成、强大的物理理解能力、丰富的创作控制功能、多平台生态整合、三档定价方案满足不同需求。需要注意生成时长仍有局限、存在一定的内容审核限制、需要关注 AI 伦理和 deepfake 风险。作为视频生成领域的标杆产品,Google Veo 为专业创作者和企业用户提供了强大的 AI 视频创作工具。

用户评论

  • 头像
    Cynthia_RichardsonSr
    从 Sora 关停之后基本全转 Veo 了。说真的 Veo 3.1 现在是活着的高端子里唯一原生音画的,Flow 工作区能把多个 8 秒片段拼成长弧,参考图保持角色一致也比 Veo 3 强太多。但别被 demo 骗了,复杂多人对话场景人物会 merge、声音分不清谁在说话,单人和双人还行,三人以上饭桌聊天基本翻车。我们做法是先用三张参考图锁人设、场景拆短、每镜单独出再剪,成片能看但工作量不小。综合下来 4.5 分给得到,前提是你能接受它的慢和贵。

  • 头像
    VictoireLeroy
    生成限制那个滚动时间戳 bug 真能把人逼疯。有回提示说达到上限,给个「明天某个时间能再生成」的时间戳,我一刷新它又往后推 24 小时,等于永远卡死。Ultra 用户也中招,信用明明没用完就是不让出片。官方认了是 known issue 但一直没修,全靠社区 workaround 续命。

  • 头像
    CDiazSr
    Veo 3.1 跟 Kling 3.0 我都重度在用,结论很清晰:要音画一体、电影质感、广告级单镜,Veo 赢;要长镜头、人物运动流畅、跑量快,Kling 赢。Kling 一条 30 秒出、口型同步还比 Veo 快,盲测里经常胜出。所以我们流程是 Veo 出主视觉、Kling 出动作戏,两套互补,谁也替代不了谁。

  • 头像
    CMitchell
    价格这块真的劝退新人。免费层和 250 刀 Ultra 之间断层太大,中间缺个三五十刀的专业档。按秒计费看着便宜,4K 带音频一条吃掉的计算量顶好几条 720p,实际每刀产出算不明白。失败生成照样扣钱,有测试说成本能飙到预期八倍,小团队真扛不住。

  • 头像
    汪艳君
    我们工作室接了 YouTube Shorts 的活,Veo 直接嵌在 Shorts 创作流里生成绿幕背景,光影匹配比传统绿幕强太多,合成的摩洛哥集市完全不违和。再加上 SynthID 水印是默认嵌的,平台分发也不用担心被标 AI 限流。缺点是复杂多人场景还是容易穿帮,老年人在网吧那段中文招牌全是乱码,得后期修。

  • 头像
    OscarSimon
    老实说用了小一个月,结论是 Veo 3.1 画质和音画同步确实是 2026 年天花板,物理模拟、光影、运镜惯性都挑不出毛病,做品牌 hero shot 没人比得过。但高负载那会儿人物会「融化」,脸和物体 coherence 掉一截,应该是谷歌为了保速度降了推理质量。做少量精品没问题,靠它每天量产几十条短视频风险太大,一致性会飘。

  • 头像
    侠客_21
    4K 升级会把我原本带声音的片段音频直接剥掉,这 bug 到现在没修好。社区里一堆人遇到,ingredients to video 模式尤其容易掉音,官方建议先预览确认有声音再升,等于多一道步骤。

  • 头像
    Susan_PerryII
    用 Gemini 帮写提示词再丢给 Veo 这招真有用,专业运镜词它吃得准,成片质感直接上一个档次。自己硬写「夕阳海滩」那种空话出来就是糊的,细节堆上去才像电影。

  • 头像
    Philip.Adams168
    对比下来 Veo 和 Sora 2 其实是两条路:Veo 适合电影感单镜头和带对话的 b-roll,Sora 2 叙事和角色一致性更强。现在 Sora 消费端都关了,长片只能老老实实回 Sora 还是转 Veo 拼,挺纠结。

  • 头像
    bigpanda969
    等 Veo 出自定义语音等太久了,商业项目要品牌一致的声音现在只能后期配,等于原生音频的优势打折扣。社区里不少人催,谷歌一直没动静,Sora 2 在角色声音上反而更自然。

  • 头像
    JoshuaRodriguezK755
    免费层每天五十来个 credit 看着多,真要迭代几条 4K 带音频的片子半天就见底,而且失败也扣。我有一回连着生成静音视频,credit 烧光了正片还没着落,气得直接去 support 论坛发帖。

  • 头像
    Mark_Nelson_Plus
    做了两周广告素材,Veo 的写实感和原生音频是真的省事,一条对话广告片直接出带配音的成片。但速度劝退,8 秒要等快两分钟,赶投流的时候急死人,最后还是 Veo 出主画面、Kling 出动作镜头各取所长。

  • 头像
    Johnny_Hill8
    中文生视频台词还是偶尔读错字,口型对得上但发音别扭。

  • 头像
    Chainnax
    Flow 工作区串联还算顺手,但高阶编辑还是得导出去剪,不够闭环。

  • 头像
    TAher
    价格模式改成 compute-used 之后完全算不清每天能出几条,Reddit 都在骂。

  • 头像
    Web3Li_nk
    内容审核也太严了吧,一个中世纪战场都给我拒了,Runway 那边随便过。

  • 头像
    Susan.SanchezZ
    试了素材到视频,丢三张参考图出来的人物一致性好多了,品牌短片终于能用。

  • 头像
    Aaron585
    Veo 3.1 的竖屏原生输出确实香,直接发 Shorts 不用裁,画质也不掉,比之前横屏裁的强太多。

  • 头像
    BobbySanders52061
    免费层够玩了,先用着。

  • 头像
    Rebecca.Hart_77
    8 秒真不够用,接龙全是缝。

  • 头像
    Ralph_Jenkins_Max
    生成慢到想睡觉,Kling 快三倍。

  • 头像
    Bruce.Vasquez_Pro5
    爱了爱了

  • 头像
    Ralph_MillerJr
    画质惊艳到我了

  • 头像
    LyubovirSuhenko
    音画同步太爽了,省了后期配音。

  • 头像
    xOğuzhanArslanoğlu_dev
    太强了!

  • 头像
    VincentHart76
    生成速度比以前快多了,点赞!

  • 头像
    OLmag
    用Veo做产品展示视频效果很好,客户很满意。电影感的构图和光影处理确实专业级别。

  • 头像
    AaronJenkins_77
    视频质量确实很高,但生成等待时间有点长。

  • 头像
    DE_mil
    试用了几天,场景延伸功能很强大。音乐视频和品牌广告都可以用,性价比比Sora高很多。

  • 头像
    GameFiGamerNielsen11
    API调用体验还不错。