【AI前沿】Nemotron-Labs-TwoTower

2026-07-05

Nemotron-Labs-TwoTower – 英伟达开源的双塔架构扩散语言模型AI工具3天前发布AI小集02Nemotron-Labs-TwoTower是什么NVIDIA Nemotron-Labs-TwoTower 是英伟达开源的双塔架构扩散语言模型,总参数约60B、活跃参数3B。模型将上下文理解与去噪生成解耦为两个独立塔,冻结的AR上下文塔处理干净token,可训练的扩散去噪塔通过交叉注意力精炼噪声块。模型基于Nemotron-3-Nano-30B-A3B构建,训练约2.1T tokens,保留自回归基线98.7%质量,生成吞吐量提升2.42倍,支持Mask Diffusion、Mock-AR与AR-only三种推理模式。Nemotron-Labs-TwoTower的主要功能双塔分离推理:将上下文编码与去噪生成分解为两个独立模块,避免单一网络”身兼两职”的性能瓶颈。三种推理模式切换:单一检查点支持 Mask Diffusion、Mock-AR与 AR-only,灵活适配不同场景需求。高质量文本生成:在保留自回归基线 98.7% 聚合基准质量的前提下,实现可并行的迭代生成。高吞吐生成加速:2×H100 环境下生成吞吐量提升 2.42 倍,显著降低推理延迟与计算成本。商用级开源部署:用NVIDIA Nemotron Open Model License 开源权重,支持企业商用与二次开发。Nemotron-Labs-TwoTower的技术原理核心思想:传统扩散语言模型使用单一网络同时承担”上下文理解”和”迭代去噪”两个角色,导致两者互相掣肘。TwoTower 将这两个职责解耦为双塔架构:上下文塔(Context Tower):冻结的 Nemotron-3-Nano-30B-A3B,采用因果注意力因果处理干净 token,负责高质量的上下文表示编码。去噪塔(Denoiser Tower):可训练模块,采用双向块注意力处理带噪声的 token 块,通过交叉注意力从上下文塔获取语义指导,逐步精炼去噪。训练方式:基于 30B 混合 Mamba-Transformer MoE 骨架,在约 2.1T tokens 上训练,用 MoE 稀疏激活实现高效计算。推理优势:扩散模型的并行迭代特性天然支持加速解码,双塔分离后去噪塔无需重复编码上下文,在保证质量的同时大幅提升 wall-clock 吞吐量。微信关注回复“开源”,加入AI开源项目交流群如何使用Nemotron-Labs-TwoTower访问 HuggingFace 模型页:打开 Nemotron-Labs-TwoTower-30B-A3B-Base-BF16 官方仓库页面。阅读模型卡与许可:确认 NVIDIA Nemotron Open Model License 商用条款,了解模型架构与硬件要求。克隆/下载权重:用git lfs或 HuggingFacetransformers库下载模型权重与配置文件。配置运行环境:准备至少 2×H100 GPU 环境,安装 PyTorch 及依赖库(参考仓库requirements.txt)。加载模型与分词器:通过AutoModelForCausalLM和AutoTokenizer加载模型,选择 Mask Diffusion / Mock-AR / AR-only 推理模式。执行推理生成:输入 prompt,调用模型生成接口,利用双塔架构完成高效并行去噪生成。微调适配:基于自有数据对可训练的去噪塔进行进一步微调,冻结上下文塔保持不变。Nemotron-Labs-TwoTower的核心优势双塔解耦,各司其职:将上下文编码与去噪生成分离为两个独立塔,避免单一网络角色冲突导致的性能瓶颈。质量几乎无损:保留自回归基线 98.7% 的聚合基准质量,扩散生成不再以牺牲输出质量为代价。推理速度翻倍:在 2×H100 环境下实现 2.42 倍 wall-clock 生成吞吐量,显著降低延迟与算力成本。一模型三模式:单一检查点支持 Mask Diffusion、Mock-AR、AR-only 三种推理方式,灵活适配不同延迟与质量需求场景。开源可商用:用 NVIDIA Nemotron Open Model License 发布权重,支持企业自由部署与商业二次开发。Nemotron-Labs-TwoTower的项目地址HuggingFace模型库:https://huggingface.co/collections/nvidia/nemotron-labs-twotowerarXiv技术论文:https://arxiv.org/pdf/2606.26493Nemotron-Labs-TwoTower的同类竞品对比对比维度Nemotron-Labs-TwoTowerLLaDA发布机构NVIDIAMIT架构设计双塔分离:冻结AR上下文塔 + 可训练扩散去噪塔(交叉注意力连接)单塔统一:单一Transformer同时承担上下文编码与掩码去噪总参数量60B(活跃3B,MoE稀疏)8B(稠密)基座模型Nemotron-3-Nano-30B-A3B(Mamba-Transformer MoE)自研Transformer训练数据2.1T tokens~2T tokens基线质量保留98.7%(相对自回归基线)~95%(相对同等规模AR模型)吞吐提升2.42×(2×H100,wall-clock)~1.5×(标准GPU环境)推理模式三种:Mask Diffusion / Mock-AR / AR-only单一:掩码扩散(随机/半自回归采样)注意力机制上下文塔:因果注意力;去噪塔:双向块注意力 + 交叉注意力统一双向注意力 + 位置编码处理核心创新角色解耦:避免单一网络”身兼两职”的性能瓶颈简单 scalable:证明扩散模型可scale至8B并逼近GPT-4质量Nemotron-Labs-TwoTower的应用场景高并发在线服务:2.42倍吞吐提升使其适合搜索引擎、智能客服等需要低延迟、高并发的实时文本生成场景。长文档生成:扩散模型的并行迭代特性适合长文本续写、报告生成、代码补全等需要多步 refine 的任务。多模式灵活部署:三种推理模式切换让企业可根据成本/质量权衡,在边缘端用 AR-only、在云端用 Mask Diffusion。商用产品开发:模型可商用许可支持企业将模型集成至写作助手、营销文案生成器、代码辅助工具等商业化产品。科研与二次创新:开源权重与论文细节便于研究者探索扩散语言模型架构、训练策略及跨模态扩展方向。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Astryx - Meta 开源的 React 设计系统下一篇LLM Admin - 开源免费的本地化 LLM 统一API,省钱又省心相关文章Text Behind Image – 开源在线图像处理工具,在图中角色背后添加文字AI小集2Shadow – AI会议助手,实时识别说话人生成会议笔记AI小集2iFable – AI角色扮演互动平台,自动生成沉浸式故事游戏AI小集3FlashVideo – 字节联合港大推出的高分辨率视频生成框架AI小集2PromptPort – AI提示词管理平台,专注于创作、优化、运用prompt技术AI小集2JoyAgent-JDGenie – 京东开源的通用多智能体系统AI小集3暂无评论再想想发表评论暂无评论…热门工具豆包LibTV秒哒AiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室绘蛙AISekoupdream办公小浣熊最新收录SkildArtStreamLake虾345Digen AIMeiGenHighReach最新文章ChatGPT Plus 和 Claude Pro 会员代充值 – 支持支付宝8分钟前EdgeBench – 字节跳动推出的 AI 学习能力基准测试框架8分钟前Page Agent – 阿里开源的 JavaScript GUI 智能体库11分钟前Vidu S1 – 生数科技推出的实时交互视频基础模型14小时前Ego Lite – 专为AI Agent设计的浏览器,实现人与AI协同工作23小时前Chichi-pui – AI图像生成与分享平台,专注日系风格23小时前AReaL 2.0 – 蚂蚁等开源的Agent在线强化学习基础架构23小时前video-use – Browser Use 团队开源的 AI 视频剪辑 Agent2天前跃迁维度 – 一站式国产 AI 模型 API 聚合平台2天前Command Code – AI 编程智能体,自动记录沉淀编码偏好2天前SemanticAudio – 港中文等推出的音频生成与编辑框架2天前TabFM – 谷歌开源的零样本表格基础模型2天前Octo – 明略科技开源的 AI-native 团队协作平台2天前ViiTorVoice – 云上曲率推出的 AI 语音合成模型3天前ChatExcel Ultra – 元空AI推出的企业级桌面版AI数据智能体3天前