通义万相Wan2.2-S2V
的有关信息介绍如下:
通义万相Wan2.2-S2V是阿里巴巴于2025年8月26日开源的多模态视频生成模型 。
该模型通过单张静态图片结合音频输入,可生成具有自然面部表情、精准口型同步及流畅肢体动作的数字人视频,支持驱动真人、卡通、动物等类型图片,生成视频长度达分钟级别 。
该模型采用MoE(Mixture-of-Experts)架构,包含高噪专家和低噪专家两个模块,总计270亿参数,每步仅激活140亿参数 。通过层次化帧压缩技术将历史参考帧长度扩展至73帧,并引入AdaIN和CrossAttention控制机制实现音频驱动视频生成。训练数据包含超60万个音视频片段,支持多分辨率推理以适应竖屏短视频、横屏影视剧等场景。模型在FID、EFID、CSIM等核心指标上达到同类最优水平,应用于数字人直播、影视制作及AI教育等领域 。
想要了解更多“通义万相Wan2.2-S2V”的信息,请点击:通义万相Wan2.2-S2V百科



