Zing-0.5 – Loopit 开源的实时交互视频世界模型AI工具2天前更新AI小集02Zing-0.5是什么Zing-0.5 是Loopit开源的实时交互视频世界模型,5B 参数,基座为 Wan2.2-TI2V-5B,采用 Apache 2.0 协议。核心能力是”联合控制”,键盘空间操作与自然语言语义改写两条链路共同进入 Causal DiT,用户可一边操控角色移动,一边随时用文字改写正在发生的世界,新指令会进入当前世界而非重置场景。模型通过训练中途切换 Prompt 学会”边玩边改”,主动扰动历史画面以抗误差累积。单卡 RTX 5090 可超 24 FPS 实时生成,一分钟流式推理成本约 6 分钱,在美团 LongCat 与复旦联合的 WBench 评测中位列实时世界模型第一。Zing-0.5的主要功能联合控制:键盘空间操作(W/A/S/D 移动 + I/J/K/L 视角)与自然语言语义改写共同作用,一边操控移动一边用文字改变世界,新指令进入当前世界而非替换场景。实时流式生成:单卡 RTX 5090 超过 24 FPS,一分钟推理成本约 6 分钱,支持无限长时序连续生成。中途语义改写:可在生成进行中随时插入文字指令(如”暴风雪””龙喷火”),模型保留视觉与操作历史,让改写发生在当前世界中。多对象同时响应:一条指令可同时驱动多个不同对象变化(如人物跪地祈祷 + 多座雕像睁眼发光)。长程一致性:角色外观、场景结构、画风(如像素风格)在持续生成中保持稳定,不漂移、不换画风。抗误差累积:训练中主动扰动历史画面,模型学会”接住自己的错误”,长时间生成不越走越偏。动作控制:8 维连续动作信号(取值 [0,1]),支持前进/后退/左右移动与四向视角变化,编码为逐帧 action residual。本地部署:5B 参数单卡可跑,Linux + PyTorch 环境,80GB+ 显存或滑窗注意力配置(RTX 4090 级别亦可),输出 H.264 MP4。开源免费:Apache 2.0 协议,代码与权重在 GitHub、ModelScope、HuggingFace 开放,基于 Wan2.2-TI2V-5B 训练。Zing-0.5的技术原理基座模型:基于 Wan2.2-TI2V-5B 训练,5B 参数量级,核心生成网络为 Causal DiT(因果扩散 Transformer),配合因果 KV 缓存支持无限长时序自回归推演。双控制链路架构:两条独立但共同进入 Causal DiT 的控制通道——空间操作走”动作链”,语义改写走”文本链”,二者共同决定接下来生成的内容。动作链(action residual):W/A/S/D 移动 + I/J/K/L 视角构成 8 维连续动作信号(取值 [0,1]),经 sin/cos 编码与因果时序卷积(不足 10M 参数)转化为逐帧 action residual,与对应视频 token 逐帧对齐后注入生成。文本链(cross-attention):自然语言指令经语言模型编码为 language tokens,通过 cross-attention 写入当前生成,实现中途语义改写。两链解耦、持续并行:文本条件改变时动作链路不中断,因此能实现”巨龙一边按原方向飞行一边喷火”这类边操作边改写的效果。训练即学会”中途改写”:训练时在自回归生成中途切换 Prompt,保留已生成的视觉历史与操作历史,用新文本条件预测后续,改写能力是训练出来的原生能力,而非推理时拼接的后加功能。抗误差累积训练:自回归生成的”历史”是模型自己的输出,误差会累积;Zing-0.5 在训练中主动扰动部分历史画面(加噪声、轻微模糊、颜色偏移、视角变化)模拟真实误差,训练目标始终保持干净,迫使模型学会从不完美历史中甄别真实状态。纯训练解法,推理零开销:抗累积能力完全内化于权重,在线推理无需额外纠错模型,不增加延迟与算力。四步 DMD 蒸馏采样:将扩散采样压缩至 4 步,是单卡实时(>24 FPS)与低成本(约 6 分钱/分钟)的关键。滑窗注意力适配显存:80GB+ 显存用–local-attn-size 97 –sink-size 9;RTX 4090 级别用–local-attn-size 33 –sink-size 5,通过局部注意力 + sink token 在有限显存内维持长上下文。输出管线:视频帧经 patch embedding 成 token 进入 Causal DiT,预测帧解码后输出 H.264 编码的 24 FPS MP4。如何使用Zing-0.5环境准备:准备硬件与系统:Linux 系统 + NVIDIA GPU(建议 80GB+ 显存,如 H100/A100;RTX 4090 级别可用滑窗注意力配置),安装基础环境:Python 3.11、PyTorch 2.9、CUDA。获取代码与模型克隆代码仓库:git clone https://github.com/seedleap/zing-world-model.git,进入目录cd zing-world-model。安装依赖:pip install -r requirements.txt。下载模型权重:pip install modelscope,然后执行modelscope download –model seedleap/Zing-0.5 –local_dir ./Zing-0.5。确认目录结构:权重包含generator/model.pt(生成器)和pretrained/(text_encoder、tokenizer、vae)。运行推理文本驱动模式(Action T2V):执行run.sh,指定–pretrained-dir、–checkpoint、–messages examples/case3_action_t2v.jsonl、输出目录和随机种子。图片初始化模式(Action TI2V):同样用run.sh,换用examples/case4_action_ti2v.jsonl等图生视频配置。按显存选择注意力参数:80GB+ 加–local-attn-size 97 –sink-size 9;低于 80GB 加–local-attn-size 33 –sink-size 5;完整历史注意力用–local-attn-size -1 –sink-size 0。交互操作键盘操控:W/A/S/D 控制前后左右移动,I/J/K/L 控制视角转动(内部为 8 维连续向量,取值 [0,1])。中途语义改写:在生成进行中输入自然语言指令(如”暴风雪””龙嘴巴喷火”),世界实时响应且场景不被重置。查看输出:生成结果为 H.264 编码的 24 FPS MP4 文件,保存在指定的–output-dir目录。零部署体验(可选):不想本地部署可等官方产品:对应功能预计两周内上线 Loopit APP 海外版,直接在 App 中体验实时互动世界。Zing-0.5的核心优势实时榜第一的硬实力:WBench 评测平均分 81.0,总榜第二仅次于一個非实时的双向模型,实时世界模型榜第一。“边玩边改”独一档:多数实时世界模型只支持”探索场景”,Zing-0.5 是少数能边操控移动边用文字中途改写世界的模型,联合控制是核心差异化。改写不换世界:新指令精准写入当前世界,只改该改的(加暴风雪、让龙喷火),不该动的(角色、画风、远处场景)纹丝不动,同类模型常”顺手换掉整个世界”。长时序不跑偏:训练中主动扰动历史画面让模型学会纠错,长时间生成角色外观、场景结构保持稳定;且是纯训练阶段解法,推理时无需额外纠错模型,不增延迟。成本与门槛双低:5B 参数单卡部署,单张 RTX 5090 超 24 FPS,一分钟流式推理仅约 6 分钱,消费级显卡即可实时交互。架构轻量优雅:动作控制链路不足 10M 参数(sin/cos 编码 + 因果卷积 → 逐帧 action residual),双控制链共同进入 Causal DiT,设计简洁高效。真开源:Apache 2.0 协议,代码 + 权重 + 部署文档全套开放,商用无门槛,基座 Wan2.2-TI2V-5B 成熟可靠。Zing-0.5的项目地址Github仓库:https://github.com/seedleap/zing-world-modelHuggingFace模型库:https://huggingface.co/seedleap/zing-0.5ModelScope:https://modelscope.cn/models/seedleap/Zing-0.5Zing-0.5的同类竞品对比对比项Zing-0.5(Loopit/SeedLeap)HiDream-O1-World(HiDream.ai)LingBot-World v2(蚂蚁集团)WBench 总排名第 2(实时榜第 1)第 3第 5综合平均分81.080.979.4画面质量(Quality)80.681.0(三者最高)81.8(三者最高)场景设定(Setting)77.882.276.8交互能力(Interaction)84.2(三者最高)80.082.8一致性(Consistency)88.5(三者最高)88.086.5物理规律(Physical)73.8(三者最高)73.369.1实时性实时(单卡 5090 超 24 FPS)未标注实时标签标注 “fast”(快速)交互类型action + 文本联合控制(可中途改写世界)动作控制动作控制参数规模5B(基座 Wan2.2-TI2V-5B)未公开未公开开源情况开源(Apache 2.0,代码+权重)未标注开源开源核心特点边操控边文字改写世界,新指令进入当前世界不重置场景画面质量与场景设定最强速度快,交互能力较好推理成本约 6 分钱/分钟流式生成未公开未公开产品落地2 周内上线 Loopit APP 海外版——Zing-0.5的应用场景AI 互动娱乐/AI 游戏:玩家用键盘操控角色在生成世界中探索,随时用语言改写剧情与环境(如下雪、召唤怪物),实现”人人可玩的生成式游戏”。“可以玩的抖音”式内容消费:短视频从”看”变成”玩”,每个用户在同一段内容里玩出不同走向,改写内容平台形态。UGC 互动内容创作:创作者生成可交互视频世界供粉丝体验,观众不再是旁观者而是参与者,衍生全新内容品类。游戏原型快速验证:游戏团队无需搭建引擎场景,用世界模型快速生成可交互 Demo,低成本验证玩法与关卡创意。虚拟直播/虚拟主播:主播实时驱动虚拟世界,观众通过弹幕文字参与改写场景与事件,增强直播互动性。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇2026 年 AI 生成图文店门头效果图 - 7 款工具深度横评下一篇Miya - 时域科技推出的 AI 音乐应用,画面可随歌词律动相关文章Yollo AI – 沉浸式AI角色对话与视频生成平台AI小集2Xiaomi OneVL – 小米具身智能团队开源的自动驾驶大模型AI小集2SceneGen – 上海交大推出的3D场景生成框架AI小集2揽睿星舟 – 翼方健数自主研发的云端AI训推一体算力平台AI小集3iFoto – AI图像处理平台,为跨境电商提供高质量的时装模特效果AI小集2FLUX-Text – 阿里推出的多语言场景文本编辑框架AI小集2暂无评论再想想发表评论暂无评论…热门工具Loomy即梦AISekoAiPPT秘塔AI搜索妙呀堆友Agent美图设计室绘蛙AIupdream办公小浣熊秒哒最新收录DeepSkillAlphaVowXCellMetaDigChatArtLexcat最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!7小时前MiniMax H3 Max – MiniMax 推出的实时视频生成模型8小时前Ling-3.0-flash-Fin – 蚂蚁百灵推出的首个金融增强模型11小时前AI