大模型推理太慢?腾讯开源 AngelSpec 打破自回归性能天花板

随着大模型参数量的狂飙与服务需求的激增,推理成本成了悬在各大厂商头顶的“达摩克利斯之剑”。特别是自回归解码带来的高昂算力消耗,让模型在真实场景下的落地变得异常沉重。为了打破这一性能瓶颈,腾讯技术团队近日正式开源了统一训练框架——AngelSpec。它通过多方案协同与工作负载的异构适配,给大模型推理装上了一台“涡轮增压器”。

因地制宜:聪明的“差异化”训练策略

大模型面对的文本特征千差万别,用一套方法打天下显然不够高效。AngelSpec 采用了“看菜下饭”的差异化训练策略,针对不同场景精准发力:

  • 高熵开放式对话:针对多轮对话这种发散性强、不确定性高的任务,系统采用了轻量且稳定的多 token 预测机制(MTP),并巧妙结合了训练时测试(TTT)与端到端总变差损失。这使得模型能够极其平滑地适应自回归展开中的状态分布。
  • 代码与数学推理:面对逻辑严密、结构约束更强的任务,AngelSpec 则祭出了专有的块扩散模型进行强化训练,深度挖掘长跨度可预测序列的潜力,让代码和公式的生成又快又准。

架构创新:DFly 框架与动态验证机制

在底层架构设计上,AngelSpec 提出了一个名为 DFly 的创新块扩散框架,从两个维度实现了效率跃升:

  1. 高吞吐与高利用率的完美融合:DFly 巧妙混合了“目标条件编码骨干”与“前序条件自回归头”。这种设计在维持高吞吐量并行生成的同时,大幅拉升了目标特征利用率,并优化了块内依赖建模能力。
  2. 聪明的动态验证机制:系统引入了自适应调整机制,能够根据当前的在线负载、硬件状态以及前缀置信度,在运行时动态调整验证深度。这就好比汽车的自动变速箱,在计算资源消耗与吞吐效率之间找到了最佳平衡点。

实测表现:Hy3 模型上的性能狂飙

纸上得来终觉浅,实战表现才是硬道理。在 Hy3 模型系列的系统测试中,搭载 DFly 方案的 AngelSpec 交出了一份极其亮眼的成绩单:

在并发数从 4 到 64 的全场景压测中,该方案均斩获了最高的平均吞吐量。相比传统的自回归解码,其性能提升极为显著,为大模型的工程化落地与高效推理提供了极其坚实的开源基建支持。

探索与贡献

AngelSpec 的开源,标志着大模型推理优化进入了更精细化、场景化的新阶段。对于开发者与研究人员而言,这无疑是一个值得深入研究的利器。

类似文章