【AI前沿】AngelSpec

2026-07-30

AngelSpec – 腾讯混元团队开源的端到端推测解码训练框架AI工具1小时前发布AI小集02AngelSpec是什么AngelSpec 是腾讯混元团队开源的端到端推测解码训练框架,基于 TorchSpec 构建,支持 MTP 自回归与 DFly 块并行共 6 种草稿架构。推理与训练解耦,推理引擎经 Mooncake/RDMA 向训练工作器流式传输隐藏状态。在 Hy3-A21B 上,DFly 实现 1.98–2.40 倍端到端加速,吞吐较 DFlash 提升 10.5–11.8%。AngelSpec的主要功能六种草稿架构统一训练:DFly、DFlash、DFlare、Eagle3、DSpark、MTP 共享一条训练流水线,切换仅需改配置。MTP 训练与 TTT 展开:支持多深度自回归展开训练,内存接近单次因果前向,通过 Ulysses 序列并行支持最长 128k 上下文。接受率对齐目标函数:支持 CE、top-k KL、LK Loss、D-PACE 加权及端到端 TV 损失,可通过配置自由组合。文档感知序列打包:Megatron 风格固定长度打包,严格跨文档隔离,同时覆盖 DFlash 与 MTP 路径。在线真实评估:训练期间通过 vLLM 等引擎执行真实推测解码,实时报告平均接受长度与逐位接受率。多推理后端支持:兼容 vLLM、SGLang、HuggingFace 等主流推理引擎。AngelSpec的技术原理推测解码基础:AngelSpec 建立在推测解码机制之上:一个轻量草稿模型并行提出多个未来 token,目标大模型通过一次前向传播使用拒绝采样完成批量验证,在不改变目标分布的前提下将单步解码扩展为多步推进。其核心挑战在于草稿接受率与验证开销之间的权衡,而 AngelSpec 从训练、架构与推理三个层面系统性解决这一问题。工作负载异构性建模:AngelSpec 将真实世界的工作负载异构性作为首要设计考量。在线请求横跨开放式对话、代码生成、数学推理与工具调用,其条件熵与延续结构差异显著:高熵对话场景下接受率随深度快速衰减,适合短序列自回归草稿;代码与数学场景存在长可预测跨度,适合块并行扩散草稿。因此 AngelSpec 训练互补的专用草稿器——MTP 面向对话数据,DFly 面向代码与数学数据——而非追求单一通用模型。共享参数多深度 MTP 训练:MTP 草稿器采用共享参数的多深度训练方案。所有逻辑预测深度复用同一物理 MTP 模块,在训练时自回归展开:深度 k+1 接收深度 k 的 argmax 预测,同时维护逐层增长的草稿 KV 缓存与对角线注意力掩码。Training-Time Test(TTT)机制使草稿器暴露于推理时遇到的自生成轨迹分布,消除教师强制带来的暴露偏差,显著改善第二、第三草稿位的接受率。微信关注回复“开源”,加入AI开源项目交流群如何使用AngelSpec环境安装:执行pip install -e “.[vllm]“与pip install mooncake-transfer-engine安装框架及 vLLM 后端。单节点快速启动:8 张 GPU 划分 4 张推理 + 4 张训练,运行./examples/qwen3-8b-dfly/run.sh即可启动完整流水线。配置覆盖:通过 CLI 直接覆盖 YAML 配置项,如training.learning_rate=5e-5 training.num_train_steps=500。Conda 环境搭建:运行./tools/build_conda.sh 1 vllm一键构建含 mooncake 的隔离环境,激活后即可使用。多节点部署:通过 Inference Controller 与 Training Controller 经 Ray 调度,结合 Mooncake 隐藏状态存储实现跨节点解耦训练。AngelSpec的核心优势工作负载专业化:MTP 针对高熵对话场景优化,DFly 针对代码与数学等长可预测跨度场景强化,避免单一草稿模型在所有领域表现平庸。DFly 架构创新:混合目标条件主干结合逐层目标视图,配合前驱条件自回归头,在保留并行生成能力的同时提升块内依赖建模。D-Cut 动态验证:将目标验证视为共享批次级资源,根据前缀置信度与运行时成本模型自适应调整验证深度,在高并发下持续转化额外负载为吞吐。分离式独立扩展:推理与训练 GPU 池通过 Mooncake 存储解耦,双方可按各自负载独立扩缩容,避免统一并行策略的次优问题。开源完整套件:同步释放框架代码、Hy3-A21B/Qwen3-8B 的 MTP 与 DFly 草稿权重、训练配置及技术报告,实现开箱即用。AngelSpec的项目地址项目官网:https://angelspec.readthedocs.io/GitHub仓库:https://github.com/Tencent/AngelSpecHuggingFace模型库:https://huggingface.co/collections/AngelSlim/angelspecarXiv技术论文:https://arxiv.org/pdf/2607.25852AngelSpec的同类竞品对比对比维度AngelSpecSpecForge出品方腾讯混元团队SGLang / 美团等社区团队核心定位统一 MTP + 块并行推测解码训练框架面向 EAGLE-3 的生产级训练框架草稿架构6 种(DFly、DFlash、DFlare、Eagle3、DSpark、MTP)以 EAGLE-3 为主,支持主流开源模型架构特色DFly 混合目标条件 + 前驱自回归头 + D-Cut 动态验证目标-草稿解耦混合并行 + TTT 稀疏树注意力优化分离设计推理/训练完全解耦,经 Mooncake/RDMA 流传输隐藏状态支持同机共存与跨节点分离,通过 SGLang 后端集成训练优化接受率对齐目标(TV/LK/D-PACE)+ 文档感知打包FlexAttention 稀疏掩码 + 原地梯度内核,内存降 93.5%开源模型Hy3-A21B、Qwen3-8B 的 MTP/DFly 权重SpecBundle(Llama、Qwen、Kimi、DeepSeek 等 EAGLE-3 草稿)性能数据Hy3-A21B 上 1.98–2.40× 加速,较 DFlash 高 10.5–11.8%Qwen3-235B 训练加速 9.99×,推理最高 4.48× 加速推理后端vLLM、SGLang、HuggingFaceSGLang、HuggingFace、自定义后端AngelSpec的应用场景大模型在线推理加速:为混元 Hy3、Qwen3 等 MoE/稠密模型部署推测解码草稿,降低自回归解码延迟。高并发对话服务:利用 D-Cut 动态资源分配,在并发 4–64 范围内维持最高平均吞吐,适配客服与助手场景。代码生成与数学推理:通过 DFly 块并行草稿捕获长可预测跨度,加速 IDE 补全、解题引擎等结构化输出任务。长上下文训练与推理:借助 Ulysses 序列并行支持 128k 上下文,适配文档分析、代码库检索等长序列场景。# AI工具# AI项目和框架©版权声明本站文章版权归AI工具集所有,未经允许禁止任何形式的转载。上一篇Codex Security CLI - OpenAI开源的AI代码安全扫描CLI工具下一篇Grok Voice Think Fast 2.0 - SpaceXAI 推出的语音模型相关文章Paw Party – AI驱动的宠物养成社交游戏平台AI小集2Qwen3-TTS – 阿里通义开源的系列语音生成模型AI小集2心动AI简历 – AI简历优化工具,智能分析岗位描述进行针对性优化AI小集2Wan2.7-Image – 阿里通义推出的 AI 图像生成与编辑模型AI小集3TIP-I2V – 超170万大规模真实文本和图像提示数据集AI小集2Webdraw – 免费 AI 应用生成平台,可将手绘草图转换为Web应用AI小集3暂无评论再想想发表评论暂无评论…热门工具豆包LibTV绘蛙AIAiPPT秘塔AI搜索TRAE编程堆友Agent美图设计室Sekoupdream秒哒办公小浣熊最新收录Lumina纳米Work袋马Sophclaw千问办公ReelFork最新文章秒悟Meoo – 1分钟生成前后端完整的网站,真0门槛开发!60分钟前Grok Voice Think Fast 2.0 – SpaceXAI 推出的语音模型1小时前Codex Security CLI – OpenAI开源的AI代码安全扫描CLI工具4小时前Lyria 3.5 – 谷歌 DeepMind 推出的 AI 音乐生成模型5小时前Qwen-Audio-Agent – 阿里开源的实时语音 Agent 框架21小时前NewMax – 本地 AI Agent 工作台,AI会真实操作浏览器23小时前RingBot AI – AI智能体AaaS平台,零代码配置与上线24小时前JiuwenSwarm – 华为开源的 AI Agent 统一工作平台1天前KerWork – 桌面级AI执行助手,可在本地完成各种任务1天前Instella-MoE – AMD 开源的混合专家语言模型系列1天前AgentLink – 心言集团推出的跨智能体工作流终端1天前ChatLens语镜 – AI 会话智能体,透镜读屏智能回复辅助2天前PerceptionBench – 月之暗面开源的视觉感知诊断基准2天前水杉输入法 – 免费开源的中文输入法,支持 AI 联想2天前Midjourney V8.2 – Midjourney推出的最新AI图像生成模型2天前