【AI前沿】阿里通义开源音乐驱动人像舞蹈视频生成模型 Wan-Dancer

2026-07-16

Wan-Dancer – 阿里通义开源的人像舞蹈视频生成模型AI工具1天前更新AI小集03Wan-Dancer是什么Wan-Dancer 是阿里通义万相开源的音乐驱动人像舞蹈视频生成模型。输入一张人物照片与一段音乐,可生成节奏精准、动作流畅、风格鲜明的高质量舞蹈视频。模型首次突破分钟级时序瓶颈,支持 15 秒至 3 分钟的 720p/30fps 超长连贯输出,覆盖中国古典舞、韩舞、街舞、踢踏舞、拉丁舞五种舞种,支持通过 LoRA 进行个性化舞蹈定制。Wan-Dancer的主要功能音乐驱动舞蹈生成:输入人物照片与音乐,自动生成与节拍精准对齐的舞蹈视频。分钟级长视频生成:突破传统 20 秒限制,稳定生成 15 秒至 3 分钟的连贯高清视频。多风格舞蹈覆盖:支持中国古典舞、K-Pop、街舞、踢踏舞、拉丁舞五种差异显著的风格。LoRA 个性化定制:仅需少量特定舞蹈数据即可训练专属动作风格,实现同款舞蹈复刻。关键帧二次编辑:全局阶段生成的关键帧支持手动修改,实现换装与动作精细控制。Wan-Dancer的技术原理全局关键帧规划(Global DiT):基于完整音乐结构生成长时一致性关键帧,规划舞蹈动作骨架与关键姿态,确保全局时间尺度连贯。局部时序细化(Local DiT):在全局关键帧基础上细化动作细节与帧间过渡,解决动作单一重复问题,提升复杂动作表现力。动态帧率适配:引入 RoPE 映射绝对时间信息,实现不同时长音乐与舞蹈动作的精确时序对齐,消除长序列漂移。光流运动连续性:基于光流的损失函数优化帧间过渡,在快速旋转、复杂步法场景中保持自然连贯。微信关注回复“开源”,加入AI开源项目交流群如何使用Wan-Dancer在线体验:访问魔搭创空间https://www.modelscope.cn/studios/Wan-AI/Wan-Dancer,上传 9:16 竖屏单人正面照片与 10–30 秒音乐,选择舞种后点击生成。本地部署:克隆 GitHub 仓库,安装依赖环境,通过 ModelScope 下载 14B 权重,分别运行全局关键帧推理与局部时序细化脚本。Diffsynth-Studio 推理:安装 DiffSynth-Studio 后,调用 WanVideoPipeline 加载全局/局部模型配置,设置参考图、音乐路径、关键帧掩码等参数进行生成。Wan-Dancer的核心优势分层解耦架构:全局 DiT 规划长时一致性关键帧,局部 DiT 细化动作细节与帧间过渡,解决时序漂移与动作重复问题。动态帧率适配:引入 RoPE 映射绝对时间信息,确保不同时长音乐与舞蹈动作精确同步。运动连续性增强:基于光流的损失函数优化,在快速旋转、复杂步法等场景中保持自然连贯。身份高保真:参考图人物身份特征在长序列中保持稳定,避免角色畸变。Wan-Dancer的项目地址项目官网:https://humanaigc.github.io/wan-dancer-project/GitHub仓库:https://github.com/Wan-Video/Wan-DancerHuggingFace模型库:https://huggingface.co/Wan-AI/Wan-Dancer-14BarXiv技术论文:https://arxiv.org/pdf/2607.09581Wan-Dancer的同类竞品对比对比维度Wan-DancerMuseDance研发机构阿里通义万相石溪大学 + 字节跳动 + 苹果核心架构分层解耦双 DiT(全局关键帧规划 + 局部时序细化)端到端 U-Net 扩散,基于 Stable Diffusion v1.5训练策略全局与局部模型分别训练、分别推理两阶段训练:第一阶段外观预训练,第二阶段冻结空间注意力并注入音乐/节拍/运动模块音乐理解专用 Music Encoder + RoPE 时间映射AST(Audio Spectrogram Transformer)提取音乐嵌入,通过交叉注意力注入节拍对齐RoPE 动态帧率适配,将绝对时间映射到生成过程Librosa 提取节拍位置,one-hot 编码后通过交叉注意力显式对齐运动控制光流损失优化帧间过渡 + Prompt 速度标注运动对齐模块:利用历史生成帧的隐状态做时序自注意力身份保持参考图像经 VAE 编码 + 全局关键帧锚定约束第一阶段学习外观 + 冻结空间注意力 + ReferenceNet 特征融合生成时长分钟级(15 秒–3 分钟)短视频片段(实验设置 4 秒 @ 12fps)分辨率/帧率720p / 30fps640×640 / 12fps(实验配置)Wan-Dancer的应用场景短视频内容创作:为抖音、快手、小红书等平台快速生成个性化舞蹈视频,无需真人出镜即可实现风格多样的舞蹈内容量产。虚拟偶像与数字人表演:为直播、虚拟演唱会及数字人账号定制特定舞种的连贯表演素材,降低虚拟角色舞蹈动作的制作成本。舞蹈教学与编舞辅助:借助音乐节拍对齐与关键帧预览功能,辅助舞蹈教师拆解动作节奏、设计编舞方案,并生成标准化教学演示视频。广告与影视预演:低成本生成分镜级别的舞蹈镜头预览,帮助导演与创意团队在拍摄前快速验证舞蹈编排与视觉风格,加速决策流程。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇LibTV Agent - LibTV 推出的专业级视频创作智能体下一篇StepAmoo - 阶跃星辰推出的新一代个人智能体相关文章MCP – Anthropic 开源的模型上下文协议AI小集6DataClaw – 开源AI对话数据导出工具,一键转为标准训练集AI小集3Multimodal Live API – 谷歌推出支持多模态交互、低延迟实时互动的AI接口AI小集2Candy.ai – AI驱动的虚拟角色聊天互动应用AI小集6ImagePulse – 魔搭社区开源的图像理解和生成模型数据集AI小集2You-TLDR – AI视频摘要工具,分析视频提取关键信息生成文本摘要AI小集2暂无评论再想想发表评论暂无评论…热门工具豆包LibTV绘蛙AIAiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录WaClawLearnBuddyAgnesCodeJobright表答ChatSPSS最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝刚刚Qwen-Audio-3.0-Realtime – 阿里推出的实时语音交互模型2小时前X2.0 – Xmax AI 推出的全球首个实时交互视频生成模型3小时前Xiaomi-Robotics-U0 – 小米推出的统一具身合成模型3小时前MOSS-VL-Realtime – OpenMOSS 开源的视觉语言模型5小时前OvisOCR2 – 阿里ATH-MaaS团队推出的端到端文档解析模型8小时前ABot-World Studio – 高德推出的通用世界模型工坊8小时前AnySearch – 专为 AI Agent 推出的实时结构化搜索引擎1天前StepAmoo – 阶跃星辰推出的新一代个人智能体1天前LibTV Agent – LibTV 推出的专业级视频创作智能体1天前PixVerse Game – 爱诗科技推出的首个实时视频游戏引擎1天前HyOCR-1.5 – 腾讯混元开源的轻量级端到端 OCR 专家大模型2天前Agnes-2.5-Flash – Agnes AI 推出的新一代高性能文本模型2天前SenseNova-Vision – 商汤开源的理解生成统一视觉大模型2天前Step Edge – 阶跃星辰推出的端侧模型全家桶2天前