通义万相是阿里云通义大模型旗下的AI绘画创作模型,由阿里巴巴研发,基于组合式生成模型Composer构建,2023年7月7日正式上线。该模型可将配色、布局、风格等设计元素拆解重组,支持文字作画、风格迁移、AI生视频等功能,覆盖图像生成、视频生成等全模态场景,应用于影视创作、广告设计等领域,并接入钉钉斜杠“/”提供文生图服务。
2023年Composer模型在ICML顶会发表,次年9月发布视频生成模型。2025年1月升级至万相2.1版本,视频生成能力显著提升并登顶VBench榜单,2月全面开源包含14B和1.3B参数的2.1模型,支持文生视频与图生视频任务,接入浙文互联好奇飞梭及荣耀智能体终端。同年支撑央视春晚舞台效果生成,为AI春晚提供技术支持,获“上海设计100+”AI创新设计奖。4月开源首尾帧生视频模型,5月开源Wan2.1-VACE视频模型,8月推出Wan2.2-S2V模型实现分钟级数字人视频生成,9月发布Wan2.5-preview系列新增音画同步生成能力,支持10秒1080P视频创作。模型开源6天即登顶Hugging Face热榜,下载量超百万,并于7月入选2025全球百大AI应用。12月发布新一代万相2.6系列模型,面向专业影视制作和图像创作场景升级,是国内首个支持角色扮演功能的视频模型。
在2026年,AI视频模型的竞争已进入白热化。阿里“通义万相2.6”是一款侧重于模型工业化与可控性的AI视频生成产品。作为阿里云通义大模型旗下的产品,该模型在影视领域参与市场竞争。
2025年12月27日,阿里云·通义万相与中影年年·多态云脑联合发起“2025-2026年度AI动画短片大赛”。大赛设置自由创作与IP改编双赛道,特别开放中影年年旗下三大经典动画IP供选手进行创新演绎。“年轮AI”一站式短剧创作平台为大赛提供技术支持。赛事即日启动,计划于2026年第一季度完成评审并公布结果。
2023年,阿里巴巴研发的组合式生成模型Composer在国际AI顶会ICML 2023上发表,其可通过对配色、布局、风格等图像设计元素进行拆解和组合,提供高度可控性和极大自由度的图像生成效果,仅需一个模型即可支持多类图像生成类任务能力。
2023年7月7日,基于组合式生成模型Composer研发的阿里云通义大模型新成员通义万相正式上线,并接入钉钉斜杠“/”,用户陆续可通过“/”在钉钉文档、群聊、会议等场景中,唤起做图、绘画等图片生成服务。通义万相接入钉钉斜杠“/”后,提供更丰富的创作能力,用户不仅可借助文档智能助手,让AI创作文章、撰写方案,还可以生成不同风格的配图、插画;或在聊天过程中,生成图片、表情等。
2024年9月19日,在2024云栖大会上,阿里云通义万相发布全新视频生成模型,支持文生视频、图生视频等,还有插画设计、涂鸦作画、局部重绘、短片创作、配乐生成等场景化能力。
2025年1月9日,通义万相迎来升级,推出万相2.1视频生成模型,在大幅度复杂运动、物理规律遵循、艺术表现等方面全面提升。根据权威评测榜单VBench的信息显示,新版通义万相登上榜首位置,超越混元、海螺AI、Gen3、Pika等国内外视频生成模型。VBench榜单显示,通义万相在运动幅度、多对象生成、空间关系等关键能力上拿下最高分,并以总分84.7%的成绩获得第一。
2025年2月25日晚,阿里巴巴宣布全面开源旗下视频生成模型通义万相2.1模型。通义万相2.1模型基于Apache2.0协议,14B和1.3B两个参数规格的全部推理代码和权重全部开源,同时支持文生视频和图生视频任务,全球开发者可在Github、HuggingFace和魔搭社区下载体验。14B模型在指令遵循、复杂运动生成等方面表现突出,1.3B版本能在消费级显卡运行,仅需8.2GB显存就可生成高质量视频,适用于二次模型开发和学术研究,极大降低了使用门槛。2月28日,浙文互联宣布通义万相接入好奇飞梭,同日,通义万相等多款语言、视觉理解、图像生成模型接入荣耀YOYO智能体,用户可通过Magic7系列手机等终端体验AI功能。3月3日,开源社区Hugging Face最新榜单显示,开源仅6天的阿里万相大模型已反超DeepSeek-R1,登顶模型热榜、模型空间榜两大榜单,成为近期全球开源社区最受欢迎的大模型。根据最新数据,万相2.1(Wan2.1)在Hugging Face及魔搭社区的总下载量已超百万,在Github的Star数超6k。
2025年4月17日,通义万相宣布“首尾帧生视频模型”开源。据介绍,该模型参数量为14B,是业界首个百亿参数规模的开源首尾帧视频模型。它可根据用户指定的开始和结束图片,生成一段能衔接首尾画面的720p高清视频。5月,阿里巴巴正式开源通义万相Wan2.1-VACE。8月26日消息,阿里开源多模态视频生成模型通义万相Wan2.2-S2V,仅需一张静态图片和一段音频,即可生成面部表情自然、口型一致的电影级数字人视频。该模型单次生成的视频时长可达分钟级。12月16日,阿里发布新一代万相2.6系列模型,该系列模型面向专业影视制作和图像创作场景进行了全面升级,全新的万相2.6是国内首个支持角色扮演功能的视频模型。
通义万相大模型覆盖文本生成、图像理解、视频理解、音频理解、图像生成、视频生成等全模态场景,辅助人类进行图片创作,可应用于影视创作、动画设计、广告设计、艺术设计、电商、游戏和文创等应用场景。
纵观通义万相的全面能力升级和多项跨界合作,未来这款模型走进更多的应用场景,凭借其迭代升级的视频质量、真实性,让视频生成由AI公司秀肌肉的“角斗场”真正转变为能产生实际效益的生产力工具。例如,影视制作团队能用通义万相快速生成多个备选方案,直观展现视觉效果;也可以直接生成部分场景,极大地降低影视后期特效的成本。电子商务场景里,增强的图像与视频生成能力或许能用于宣传品生成、AI试衣等环节,在提升消费体验的同时还能降低成本。而在艺术领域,通义万相的风格化能力和复杂提示词的理解能力,能帮助用户快速生成具有特定风格的艺术作品,或是对自己原创的艺术作品进行高效的再创造、再利用,节省部分重复性劳动,让创作者能专注于创意本身。此外,通义万相还具备简洁直观的交互界面,这意味着即便是非专业人士也能享受到这项技术的便利,显著降低创作门槛,使更多普通用户能够轻松创作高质量的视频内容,满足个性化需求。
2025年7月31日消息,通义万相入选2025全球百大AI应用。
通义万相的问世意味着阿里云在大模型领域已经具备处理或生成文本、语音和图片等模态的能力。通义万相视频生成大模型集成了多项创新技术,有效解决画面表现力和大幅度运动等视频生成技术难题。针对运动生成和物理模拟等难点优化算法,实现了大幅度主体运动和运镜控制,并有效模拟真实世界物理特性;设计了高压缩比、高质量视频VAE框架,有效降低视频信息冗余,并保持高质量视频重构能力;同时,基于轻量微调框架和精选数据集优化训练,在中式传统元素、风格化视频生成上表现更好。
截至2023年7月7日,阿里巴巴达摩院(杭州)科技有限公司已申请注册“通义万相”商标,国际分类为网站服务、科学仪器、广告销售等,商标状态为等待实质审查或初审公告。
阿里旗下的通义万相在春晚这一全国瞩目的舞台上,展示了视频生成技术令人瞩目的显著进步。通义万相凭借对真实物理规律的深度理解、复杂影视效果的完美呈现以及稳定清晰的输出能力,几乎满足了人们对视频生成模型理想形态的全部期待。这款模型在落地场景时的积极探索和应用尝试,更为视频生成赛道带来了广阔的想象空间,有望引领该领域的新趋势。(网易新闻评)
通义万相之所以能“手把手”带着玩家玩转AI文生图,主要是因为其本身基于阿里研发的组合式生成模型Composer,它是一种基于扩散模型的“组合式生成”框架,该框架基本原理是先将图像拆解成不同设计元素(配色、草图、布局、风格、语义、材质等),再使用AI模型将这些元素重新组合,中间使用的元素可以自由编辑。假设有100张图片,每张图片拆成8种元素,则全部元素的组合方式有1008种,这被阿里云称为“组合爆炸”,可以给人类设计师生成图片提供极大的自由度和想象空间,而极强的细分下,也让用户能够生成符合自己想法的图片。
针对精准理解和模拟物理世界是当下视频生成模型的核心难题,通义万相团队采用自研高效的VAE和DiT架构,有效增强时空上下文关系建模能力。在DiT的设计中,全新通义万相使用时空全注意机制,这一机制让模型能够更准确地模拟现实世界的复杂动态;团队还引入了参数共享机制,不仅提升了模型的性能,还有效降低了训练成本;此外,针对文本的嵌入进行优化,实现更优的文本可控性的同时也减少了计算需求。在视频VAE方面,通义万相设计了一种创新的视频编解码方案。通过将视频拆分成若干块(Chunk)并缓存中间特征的方式,代替直接对长视频的E2E编解码过程,实现显存的使用与原始视频长度无关,从而能够支持无限长1080P视频的高效编解码,这一关键技术为任意时长视频的训练提供了新的路径。
在全新架构下,通义万相在大幅度的肢体运动和肢体旋转场景的视频生成上表现更稳定,即便是花样滑冰、游泳、跳水等运动视频也能保持肢体协调并符合正常运动轨迹。通义万相在文字视频生成上实现了突破,成为首个支持中文文字生成能力、且同时支持中英文文字特效生成的视频生成模型,可满足广告设计、短视频等领域的创作需求。例如,用户输入“平拍一位女性花样滑冰运动员在冰场上进行表演的全景。她穿着紫色的滑冰服,脚踩白色的滑冰鞋,正在进行一个旋转动作。她的手臂张开,身体向后倾斜,展现了她的技巧和优雅”,通义万相即可精准理解语义,并生成一段接近专业滑冰运动员的视频。
通义万相基于阿里研发的组合式生成模型Composer,其可通过对配色、布局、风格等图像设计元素进行拆解和组合,提供高度可控性和极大自由度的图像生成效果。在基础文生图功能中,可根据文字内容生成水彩、扁平插画、二次元、油画、中国画、3D卡通和素描等风格图像;在相似图片生成功能中,用户上传任意图片后,即可进行创意发散,生成内容、风格相似的AI画作;该模型还在业内率先支持图像风格迁移,用户上传原图和风格图,可自动把原图处理为指定的风格图。
文字作画
在通义万相对话框输入文字提示词,生成相对应的图片,支持中英文输入,支持智能扩写辅助创意,提供预设提示词快速开始使用。通义万相提供结构化的常用提示词内容,分类包括风格、光纤、材质、色彩、构图等,可以复用咒语快速得到想要的效果。通义万相支持16:9、4:3、1:1、3:4、9:16等多种预设比例选择,以适应不同场景、终端的差异化使用诉求。并可通过提示词(主体+场景+风格)提升画面的品质感与控制力。
通义万相的基础文生图功能中,可根据文字内容生成水彩、扁平插画、二次元、油画、中国画、3D卡通和素描等风格图像;在相似图片生成功能中,用户上传任意图片后,即可进行创意发散,生成内容、风格相似的AI画作;该模型还在业内率先支持图像风格迁移,用户上传原图和风格图,可自动把原图处理为指定的风格图。
文生视频
在通义万相对话框输入文字提示词,描述视频的画面和运动过程,生成一段视频内容。支持中文和英文,支持16:9、4:3、1:1、3:4、9:16等多种比例选择,以适应不同场景、终端的差异化使用诉求。通义万相提供灵感扩写功能,可以根据简单的提示词内容,通过智能扩写获得更完善的提示词描述,显著提升视频画面丰富度与表现力。并可通过提示词(主体+场景+风格)提升画面的品质感与控制力。
图生视频
在通义万相对话框上传或拖拽一张图像作为视频的首帧,辅以文字描述视频的运动过程和运镜效果,上传图像支持任意给裁剪,支持中文和英文提示词描述。对上传的图像支持任意比例或预设比例裁剪,方便对图像进行构图和二次创作,支持旋转。并可通过提示词(主体+场景+运动)来描述视频中所包含的内容和运动过程,提示词越完整、精确和丰富,生成视频的品质越高,且越贴近期望生成的内容。
拿捏中国风,AI让创意走进现实
通义万相2.1在本届春晚中的参与可谓是全方位、全流程的,涵盖从预告片到现场舞美等多个环节。这款模型能准确理解多样的艺术风格,为创意工作者提供了有力的创作工具,帮助他们将脑海中的想法变为现实。对于中国风的内容,通义万相可谓是手拿把掐。在央视春晚预告片中,通义万相文生图让中国非遗苏绣焕发新生。万相不仅成功捕捉了苏绣的整体艺术风格,还将细节还原到每一根丝线,而每一副画面的风格控制也较为稳定,最终给这项千年传统技艺带来了别开生面的呈现形式。同款工具还在通义官网中上线,点击网站上放的“非遗刺绣”互动玩法,用户就可以输入文字,即刻生成一张刺绣图。仅需等上几秒钟,便可生成一只栩栩如生的刺绣凤凰。
春晚舞台上的诸多舞美效果也由通义万相提供支持。例如,央视春晚节目《方的言》舞台背景的毛毡效果,便是由通义万相的文生图、图生视频等技术实现。图中的高楼、古建被转化成了温暖、柔和、立体的毛毡画,与歌曲的主旨相得益彰。在莫文蔚与毛不易合唱的《岁月里的花》节目中,阿里通义万相利用图像风格化和首尾帧视频生成技术,生成了沉浸式的油画风舞美效果。
AI业内炙手可热
在AI业内1000余名创作者参与的2025年AI春晚中,通义万相为三分之一的节目提供了技术支持,升级后的模型能更好地理解和模拟物理世界,最终为观众呈现了极佳的观影体验。其中,取材自南宋画家刘松年名画《四景山水图》的同名AI MV,一亮相便引来众多网友的称赞。
通义万相显著改善了困扰视频生成模型的幻觉问题,尤其是在涉及复杂肢体动作的画面中。通义万相团队自研了VAE和DiT架构,增强了模型的时空上下文建模能力,让复杂的肢体运动、大幅度动作、镜头的移动都能稳定展现。在AI MV《四景山水图》中,通义万相2.1完美地呈现了“拥炉对酒,折梅入瓶”的诗意画面。画面中人物的手型、持杯动作都十分自然,温酒的热气蒸腾也得到不错的还原。即便是处理折梅入瓶这样细致入微的动作时,通义万相2.1也没有出现翻车的情况。人物饮茶、放杯、合书、转身的动作一气呵成,运动轨迹流畅,人物与杯子、书本的互动也符合物理规律。《四景山水图》中的水墨画风格鲜明,人物、花鸟传神,还精准把握到了留白这一中国传统艺术中的独特审美理念,给观众以无限的想象空间。
通义万相具备文生组图能力,DiT架构增强了文生图的上下文能力,通义万相首次实现了中文文字视频生成功能,能在图片与视频中准确呈现中文内容。此外,通义万相还支持艺术字一键生成,文字还可以加上视频特效选项,如过渡、粒子效果、模拟等。可对多张图像进行拼接与联合描述,轻松实现关联图像间的组合生成,解锁了通义万相生成电影分镜、四格漫画、情侣头像等高度关联画面的能力。