智谱清影是智谱AI于2024年7月26日发布的AI视频生成工具,基于自研CogVideoX模型开发,支持通过文本或图片生成6秒时长、1440×960分辨率的视频,理论生成时间约30秒,并提供卡通3D、黑白、油画、电影感等多种视觉风格及背景音乐适配功能。该工具上线于清言App的PC端、移动端及小程序端,免费向用户开放文生视频、图生视频服务,同步推出“老照片动起来”小程序实现静态照片动态化处理。
清影升级支持生成10秒时长、4K分辨率、60帧率的视频,并增加了AI音效生成功能。2025年1月,智谱清影发布2.0版本,重点优化画面主体运动控制及指令理解能力,模型性能提升,输出流畅度与画质有所优化,并开放API接口供开发者调用。智谱AI上线支持4K60帧的“新清影”,并开源其底层模型CogVideoXv1.5。其底层CogVideoX模型采用DiT架构,融合文本、时间、空间三维数据,推理速度较前代提升6倍。该工具与“捏Ta”平台达成合作并上线。
智谱清影是智谱AI于2024年7月26日发布的AI视频生成工具。该工具基于自研CogVideoX模型,支持文生视频和图生视频功能。其底层CogVideoX模型采用DiT架构,融合文本、时间、空间三维数据。2025年1月,智谱清影发布2.0版本,优化了画面主体运动控制及指令理解能力,并开放了API接口。后续版本支持生成更长时长、更高分辨率与帧率的视频,并增加了音效生成功能。该工具与“捏Ta”平台存在合作。
2024年7月26日,智谱AI正式发布视频生成大模型产品——清影(Ying),标志着智谱AI正式入局文生视频及图生视频赛道。
清影底座的视频生成模型是CogVideoX。CogVideoX能将文本、时间、空间三个维度融合起来,参考了Sora的算法设计,同样采用了DiT+Transformer的架构。
智谱AI在CogVideoX上进行了多项自研改进。在数据层面,使用视频理解模型CogVLM2-Video将大量视频变成适合做文生视频训练的素材。在算法层面,自研了高效三维变分自编码器结构(3D VAE),可对视频进行强力压缩,仅相当于原视频大小的2%。在模型架构层面,自研了一个将文本、时间、空间融合起来的transformer架构,摒弃了传统的cross attention模块,在输入阶段就将文本嵌入和视频嵌入连接起来以便更充分地进行两种模态的交互。智谱AI承认其“清影”与世界顶级水平(如OpenAI Sora)在效果上存在差距,并将其定位为一个初步的阶段性成果。
2024年7月26日,清影在智谱清言的PC端、移动应用端以及小程序端正式上线,所有用户均可免费体验AI文本生成视频和图像生成视频的服务。
2024年11月8日,智谱清影迎来升级,支持生成10秒、4K、60帧超高清视频,并预告音效生成功能即将上线。
2025年1月21日,清影2.0版本发布,模型性能大幅提升,重点优化了动作连贯性与指令遵循能力。
2026年2月10日,“新清影”上线,支持4K60帧视频生成与AI音效,并宣布开源CogVideoX v1.5模型。
AI文生视频:输入文本自动生成动态视频
AI图生视频:上传图片转换为动态视频
多风格渲染:支持卡通3D/油画等风格
智能配乐:自动匹配背景音乐
老照片修复:静态照片动态化处理
智谱清影基于智谱AI自研的视频生成大模型CogVideoX开发,其后续迭代版本为CogVideoX v1.5。该模型采用DiT (Diffusion Transformer)架构,智谱自研了一个将文本、时间、空间三个维度全部融合起来的Transformer架构,其注意力模块采用了3D全注意力机制,位置编码模块设计了3D RoPE。
支撑模型效果的关键技术包括智谱自研的高效三维变分自编码器结构(3D VAE)、因果三维卷积(Causal 3D convolution)以及端到端的视频理解模型。
通过优化,CogVideoX相比前代CogVideo推理速度提升了6倍。在2026年,其支持生成10秒、4K分辨率、60帧的视频。2026年2月,智谱宣布开源CogVideoX v1.5模型。
智谱清影集成了自研的AI音效模型CogSound,可根据视频内容生成匹配音效。