Veo是由谷歌公司开发的AI视频生成模型,于2024年5月14日在美国I/O开发者大会正式发布。该模型支持通过文本或图像输入生成超过60秒的1080P高清视频,用户可自定义光照、镜头语言等参数,生成效果被视为对标OpenAI的Sora模型。2025年5月21日,谷歌发布第三代模型Veo 3,接入Gemini平台并向全球159个市场开放。2025年10月,谷歌推出Veo 3.1,提升了叙事控制、音频融合与画面真实感。此外,Veo 2模型于2025年12月被应用于机器人策略评估系统。
2024年5月14日,谷歌召开I/O 2024开发者大会,正式发布视频生成模型Veo。Veo支持文本生成超过1分钟的1080P超高清视频,对标OpenAI的Sora模型。
2025年5月21日消息,I/O开发者大会上,谷歌发布第三代视频生成模型Veo 3。Veo 3首次实现原生音视频同步生成,能自动生成与画面同步的对话、音效和环境音,并接入Gemini平台。
2025年10月15日,谷歌正式推出新一代AI视频生成模型Veo 3.1,通过一系列创意与技术升级,显著提升了AI视频的叙事控制能力、音频融合度与画面真实感。Veo 3.1增强了音频生成、叙事控制和移动端优化,支持以9:16的纵向比例生成竖屏视频,专门适配手机显示。
2025年12月,谷歌DeepMind团队将Veo 2模型应用于机器人策略评估系统,实现了带动作条件约束、具备多视角一致性的视频仿真,用于机器人领域策略评估。
模型架构
Veo是一个模型大合集,融合了GQN、DVD-GAN、Imagen-Video、Phenaki、WALT、VideoPoet、Lumiere、Transformer和Gemini等多种谷歌技术。
音视频同步技术
Veo 3引入了V2A(Video-to-Audio)音视频同步技术,打破传统AI视频“先画面后音频”的割裂模式,实现画面与音效、对话、环境音的实时同步生成。
一致性与分辨率提升
Veo 3.1在场景一致性、图像要素生成方面进行改进,其“Image Ingredients(图像要素)”生成视频能力得到明显提升,能够在不同场景切换中保持角色和叙事的一致性。同时,模型支持将背景图像、材质纹理、物体元素在多个场景之间重复使用。在输出规格上,支持720p/1080p分辨率,并可借助视频超分辨率功能输出至4K分辨率。
视觉推理能力
Google DeepMind团队提出“帧链”理论,系统地评估了Veo 3在未经过特定任务微调的情况下,所展现出的从基础感知到复杂视觉推理的潜力,包括图像分割、物理现象建模、图像编辑以及在迷宫求解等任务中表现出的零样本推理能力。
机器人仿真应用
Google DeepMind Gemini Robotics团队于2025年12月15日提出基于Veo的机器人策略评估系统,该系统使用Veo 2作为基础模型,实现动作条件约束和多视角一致性的视频仿真。研究在一个大规模机器人数据集上对预训练的Veo 2模型进行了微调,使其能够在给定初始帧和未来机器人位姿的条件下,生成拼接后的多视角未来帧。
Veo能够根据文本、图像创建超过60秒的高质量1080P视频,用户可对光照、镜头语言、视频颜色风格等进行设定。用户仅需写出文本提示即可生成视频,比如文本提示:“在宁静的山地平移镜头,相机慢慢露出白雪皑皑的山峰、花岗岩岩石和倒映天空的清澈湖泊。”“一艘宇宙飞船在浩瀚的太空中穿梭,星星划过,高速,科幻”。根据谷歌公布的演示视频,Veo生成的小狗毛发十分细腻,走路动作、姿态也非常逼真。
Veo模型通过个人订阅、API调用和企业服务等多种模式向用户提供服务。
个人用户订阅计划
Veo 3主要面向谷歌Ultra订阅用户开放。Veo 2集成到Gemini应用中,供Gemini Advanced订阅用户使用。此外,还存在Pro会员计划。
API按需计费模式
Veo 3.1通过Gemini API提供,采用按成功生成视频时长计费的模式,无免费额度。其定价策略针对不同分辨率、帧率模式及功能进行区分。
企业级服务
企业用户可通过Vertex AI平台接入Veo模型。企业用户可获得定制化服务,如分辨率、帧率自定义和功能优先级调整等。
内容安全与标识
为标识AI生成内容,Veo生成的视频会携带SynthID数字水印。部分版本(如Veo 3)在视频画面右下角还会有可见的“Veo”水印。