【AI前沿】JoyAI-Video-Edit

2026-08-06

JoyAI-Video-Edit – 京东开源的实时流式视频编辑模型AI工具16小时前发布AI小集03JoyAI-Video-Edit是什么JoyAI-Video-Edit是京东开源自研的实时流式视频编辑模型,基于16B参数自回归扩散架构,在720P分辨率下实现30FPS推理速度,支持任意时长稳定流式编辑。用户可通过自然语言指令在视频播放过程中实时修改人物、场景、风格及物体,无需等待完整视频生成。模型在OpenVE-Bench评测中超越所有流式编辑方法,各项指标全面领先,同时可为具身智能提供大规模数据合成路径。JoyAI-Video-Edit的主要功能实时流式编辑:视频帧到达时即时编辑,无需预先知道完整序列。开放式指令控制:支持全局风格迁移、局部对象增删改、背景替换、动作调整及参考图引导编辑。任意时长处理:突破秒级或分钟级限制,可持续随视频播放进行稳定编辑。720P高吞吐部署:端到端pipeline在720×1280分辨率下达30.19 FPS。多维度编辑能力:覆盖人物换装、场景变换、风格转换、物体替换与字幕编辑等任务。JoyAI-Video-Edit的技术原理MLLM条件编码器:用多模态大语言模型将自然语言指令编码为编辑条件,实现开放式语义控制。因果视频VAE:采用因果时序结构的变分自编码器对视频帧进行压缩与重建,保证流式场景下的时序一致性。16B参数MMDiT骨干:用16B多模态扩散Transformer为核心,融合文本与视觉特征进行自回归扩散生成。自回归分布匹配蒸馏:通过对齐自回归分布的蒸馏策略加速推理,显著降低训练与推理的分布差异。长时域优化与有界KV推理:引入长时域稳定性优化及有界KV缓存机制,抑制累积时序漂移并维持高吞吐量。微信关注回复“开源”,加入AI开源项目交流群如何使用JoyAI-Video-Edit环境准备:创建Conda环境python=3.10并安装requirements.txt依赖。下载权重:从Hugging Face获取模型文件,按指定目录结构放置检查点。启动服务:进入deploy目录执行bash run_server.sh启动本地服务器。访问界面:浏览器打开http://localhost:8080进入交互式编辑界面。实时编辑:上传视频或接入摄像头流,输入自然语言指令即可边播边改。JoyAI-Video-Edit的核心优势实时流式编辑:视频帧到达即处理,无需等待完整序列,实现真正的”边播边改”交互体验。速度与质量双优:720P分辨率下端到端推理达30.19 FPS,在OpenVE-Bench评测中超越所有流式与离线编辑方法。任意时长稳定输出:突破传统模型仅支持秒级或分钟级片段的限制,可持续随视频播放进行无漂移稳定编辑。开放式语义控制:基于MLLM条件编码器,支持自然语言指令驱动的全局风格、局部对象、背景替换及参考图引导等多维度编辑。高效推理架构:16B参数自回归扩散Transformer配合分布匹配蒸馏与有界KV缓存,显著降低训练推理差异并抑制时序累积误差。JoyAI-Video-Edit的项目地址GitHub仓库:https://github.com/jd-opensource/JoyAI-Video-EditHuggingFace模型库:https://huggingface.co/jdopensource/JoyAI-Video-EditarXiv技术论文:https://arxiv.org/pdf/2608.03974JoyAI-Video-Edit的同类竞品对比维度JoyAI-Video-EditSANA-Streaming模型规模16B参数2B参数推理速度37.21 FPS (DiT)约54 FPS (DiT)编辑质量3.60 (OpenVE-Bench)约2.6编辑类型开放式多维度编辑流式编辑分辨率支持720P稳定输出较低分辨率为主时序稳定性任意时长,有界KV优化短片段为主JoyAI-Video-Edit的应用场景短视频创作:创作者可在视频播放过程中实时替换人物服装、调整场景风格,提升内容生产效率。直播实时特效:主播边播边改背景或添加虚拟元素,实现互动式直播视觉增强。家装与室内设计:用户在浏览房间视频时实时更换家具、墙面材质与灯光效果,辅助装修决策。影视后期预演:导演在剪辑阶段快速尝试不同视觉风格与场景替换,降低试错成本。具身智能数据合成:将人手操作视频转化为机械臂操作素材,低成本扩展机器人训练数据规模。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Hy ASR 3.0 preview - 腾讯混元推出的新一代语音识别模型下一篇SeedRealtime - 字节跳动推出的原生音视频全双工大模型相关文章PixVerse V2.5 – 爱诗科技推出的AI视频生成工具,视频生成提速200%AI小集3tldraw – AI白板绘图工具,开源免费的无限画布和多种绘画功能AI小集4Skywork Deep Research Agent v2 – 昆仑万维推出的升级版深度研究智能体AI小集3Solar – AI应用开发平台,支持全栈应用开发AI小集2Meku – AI开发平台,简单描述生成Web应用和网站AI小集2文途AI – AI学术论文辅助工具,输入论文主题和要求3步搞定论文写作AI小集2暂无评论再想想发表评论暂无评论…热门工具LoomyLibTV绘蛙AIAiPPT秘塔AI搜索蛙蛙写作堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录青虎AI妙呀纳逗Pro图改改AstraFlow星图不繁简历最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!55秒前RabbitVis – 兔展智能推出的一站式 AI 设计生产工具2分钟前InstructAV2AV – 智源联合北大开源的音视频联合编辑模型14分钟前Get3W – AI 模型聚合平台,统一接口自由切换模型16小时前Shieldstral – Mistral AI 开源的多模态内容安全分类模型16小时前MAGI-2-preview – Sand.ai 开源的多模态视频生成模型16小时前SeedRealtime – 字节跳动推出的原生音视频全双工大模型16小时前Hy ASR 3.0 preview – 腾讯混元推出的新一代语音识别模型23小时前Qwen-CUA – 阿里 Qwen 等推出的原生 Computer Use Agent1天前MemHarness – 上海 AI Lab 等推出的智能体记忆重构框架1天前ForgeStencil – 面壁智能推出的 Stencil 全自动研究部署系统2天前Orchard – 微软研究院开源的 Agentic AI 建模框架2天前E-Bench – 腾讯混元等推出的智能体评测基准2天前SenseNova U1.5-Lite-Preview – 商汤开源的轻量多模态模型2天前Polar – AI 浏览器,自动跨站收集整合信息2天前