7月29日,腾讯混元团队正式开源AngelSpec。一个覆盖 drafter 训练、架构设计到线上部署的投机解码框架,并同步开源 Hy3-A21B 的MTPDFly drafter 权重及训练代码。

本次开源最大的亮点在于AngelSpec 全链路开源,混元将训练工具+ Hy3-A21B 的 MTP / DFly drafter 权重与训练代码一次性放出。

新一代 drafter DFly取得新SOTA,4–64 全并发档位、六大 benchmark 均取得更高吞吐,较 AR 基线平均加速 1.98–2.40×(代码/数学峰值 2.86×),比 DFlash 再快10.5–11.8%;平均接受长度较 DFlash +30%、约为 MTP 的 1.6 倍。

D-cut榨干高并发,线上真实流量额外提升 +15.7%吞吐; MTP + TTT 攻克对话场景训练-推理不一致,平均接受率 52.8%→66.4%、接受长度 2.58→2.99。从训练到线上,把投机解码的加速真正做到端到端可用。

 

 

DFly:更强的并行draft架构

DFlash 以扩散方式并行生成 block 内所有 token,draft 延迟几乎与 block 长度无关,但它有个短板:所有 draft 层共享同一份 target 上下文,且 block 内 token 互相不可见、后段接受率快速衰减。

 

DFly 针对性地做了三项改进:

  • 混合 target 条件注入:结合 DFlash 的全连接共享投影(跨层交互)与 DFlare 的逐层加权融合(层特异性视角),每个 draft 层同时获得全局语义和匹配自身深度的 target 特征。
  • 隐状态校正自回归头:并行主干之上加一个轻量校正头,用前一位置已选token 修正当前位置的分布。主干保持全并行,只有这个小头从左到右执行。
  • 面向接受率的训练目标:先用 D-PACE 加权的 LK 损失冷启动,再切换到端到端 TV 损失,直接优化期望接受长度。

 

三项叠加后,DFly 平均接受长度达4.79,明显高于 DFlash 的 3.69 和 MTP 的 3.00;在结构性强的场景优势更大,Math500达5.23,HumanEval 达5.52

 

D-cut:把验证当作 batch 级共享资源

长 block 有一个部署侧代价:高并发下 target 验证成为计算瓶颈,被拒绝的 draft 后缀白白占用 batch 容量。实测 DFly 在并发 48 之后吞吐饱和,继续加并发只会拖慢每用户速度。

 

D-cut 在每个解码步做两件事:

  1. 用 drafter 的逐 token 置信度估计各请求在不同验证深度下的期望推进量,跨请求全局排序,保留收益最高的前缀;
  2. 结合启动时预先测好的延迟表,选择「期望收益/ 实际成本」最大的验证比例。

 

⚡ 突破高并发吞吐天花板

效果上,负载低时自动保留深 draft,负载高时主动裁剪。在Hy3线上流量回放中,并发 48/56/64 相对 DFly 分别提升+3.0% / +9.2% / +15.7%;同等每用户延迟下聚合吞吐高14%

 

MTP + TTT:搞定不好预测的通用对话场景

没有一种 drafter 通吃所有场景:对话熵高,长 block 后段大概率被拒;代码数学可预测跨度长,短 horizon 又浪费加速空间。所以 AngelSpec 采用双 drafter 路线——DFly 负责代码/数学,MTP 负责高熵对话。

原始 MTP 块按单步 teacher forcing 训练,推理时却要递归消费自己的预测,深层位置接受率大幅下降。混元用 TTT(训练时对共享 MTP 块做同策略自回归展开)修复这一训练-推理不一致,配合 target 模型 rollout 生成的训练数据:平均接受率从52.8% 提升至 66.4%,平均接受长度从 2.58 提升至 2.99

 

AngelSpec 框架

前述 drafter 均由 AngelSpec 训出。工具基于 TorchSpec 构建——采用其分离式设计,推理引擎运行 target模型、隐状态经 Mooncake RDMA 流式传输至训练进程,两侧独立扩缩——并针对本报告的方法做了全链路扩展:

  • TTT 与长上下文训练:逐深度增长的 draft KV cache 免去每步重展开前缀;配合序列并行与序列打包,支持 128k 长上下文训练。
  • 真实接受率评估:内置评估服务器周期性用 vLLM 对最新 checkpoint 执行真实投机解码,直接报告 serving 侧的平均接受长度与逐位置接受率,不依赖损失等代理指标。
  • 插件化:target、优化器等通过配置组合;新架构与训练目标通过统一接口接入,无需改动训练主循环。

 

🏆实测:DFly 表现稳健

在 Hy3-A21B 上和主流开源模上,DFly 在接受长度与真实吞吐上更优:平均接受长度进一步提升,并在线上真实流量的各并发档位上取得更好吞吐。

 

实验配置:DFly, DFlash, DSpark 三种块扩散 drafter 均采用 block8,MTP 使用 3 个投机 token。

  1. 接受长度:更好的draft质量,DFly 平均接受长度 Hy3-A21B 达4.79、主流开源模达5.41,较 DFlash 约+30%、较 MTP 约1.6×;结构性越强、优势越大,HumanEval 上分别高达5.60 / 5.52
  2. 端到端吞吐:全并发档位更高(Hy3 295B-A21B,TP=8,temperature 1;相对 AR 基线的平均加速比)

 

DFly-8 在 4–64 全部并发档位均取得平均加速1.98–2.40×,代码 / 数学单项峰值2.86×;再叠加 D-cut,高并发下还能额外提升+15.7%

 

混元在 Hy3 及其他开源模型上用 MTP、DFly 等方法训练的 drafter 权重,以及 AngelSpec框架,现已全部开源,欢迎使用与共建。

 

  • 技术报告:https://arxiv.org/abs/2607.25852
  • GitHub:https://github.com/Tencent/AngelSpec
  • 文档:https://angelspec.readthedocs.io
  • 模型:https://modelscope.cn/collections/AngelSlim/AngelSpec

 

Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐