腾讯发布AngelSpec框架让Hy3模型推理速度提升至近两倍

1 阅读4分钟开源

背景与动机

随着大模型推理成本居高不下,投机解码(Speculative Decoding)成为提升吞吐的关键技术。传统方案往往只针对单一草稿模型进行训练,难以兼顾对话、代码、数学等多样化业务负载。腾讯在此背景下推出 AngelSpec,将工作负载异构性作为首要设计约束,提供统一的训练流水线,支持 MTP(多令牌预测)和 块并行(Block‑Parallel)两大草稿架构。

AngelSpec 框架核心特性

  • 统一配置驱动:同一套配置文件即可训练六种草稿模型(DFly、DFlash、DFlare、Eagle3、DSpark、MTP)。
  • Hybrid Target Conditioning:在块并行草稿中引入混合目标条件分支,融合全连接层与层级融合权重,实现更细粒度的目标信息传递。
  • Hidden‑Correction AR Head:在并行骨干后加入轻量前缀‑条件化头,仅在必要时进行顺序计算,保持并行优势的同时提升接受率。
  • D‑cut 运行时自适应预算:通过动态调节验证预算,在真实流量下将吞吐提升至 981 tok/s(c64),相较基线提升 15.7%
  • 深度‑一致训练:采用 Training‑Time Test 思路,深度 k+1 使用深度 k 的 arg‑max 预测而非真实标签,确保草稿在推理时的自回归行为更加稳健。

DFly 与 DFlash 的技术对比

维度DFlashDFly
目标条件方式单一全连接共享上下文混合:全连接 + 层级融合残差
并行度完全并行并行骨干 + 串行小头
接受率提升中等在 Hy3‑A21B 上 +29.8%(从 3.69 到 4.79)
代码/数学基准5.32 avg5.41 avg,在所有五个基准上均居首

性能评估

  • Hy3‑8B:DFly 在平均接受长度上达到 5.41,超越 DSpark(5.32)与 DFlash(4.57)。
  • Hy3‑A21B:DFly‑8 在并发 4‑64 下提供 1.98‑2.40× 的加速;在 MT‑Bench 上略逊于 DSpark(3.77 vs 3.67),但在代码/数学任务上优势明显。
  • Hy3‑295B‑A21B:在 TP=8、并发 64 时,DFly‑8 达到 981 tok/s,比基线提升 15.7%,接受率仅下降 2.8%

生态与开源发布

AngelSpec 基于 TorchSpec 扩展,内部使用 Mooncake‑backed RDMA 实现隐藏状态的零拷贝传输,兼容 vLLM、SGLang、Transformers 三大推理后端。七个检查点已同步至 Hugging FaceModelScope,包括 no‑thinkhigh‑think 两种 DFly 变体。

“我们希望通过统一的训练框架,让不同业务场景都能快速落地投机解码。” — 腾讯 AngelSpec 项目负责人

未来,腾讯计划继续扩展数据池(已加入 700K 代码/数学提示),并在社区贡献更多文档与评测基准,推动投机解码在实际生产环境中的落地。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。