大模型推理太慢?腾讯开源 AngelSpec 打破自回归性能天花板
随着大模型参数量的狂飙与服务需求的激增,推理成本成了悬在各大厂商头顶的“达摩克利斯之剑”。特别是自回归解码带来的高昂算力消耗,让模型在真实场景下的落地变得异常沉重。为了打破这一性能瓶颈,腾讯技术团队近日正式开源了统一训练框架——AngelSpec。它通过多方案协同与工作负载的异构适配,给大模型推理装上了一台“涡轮增压器”。
因地制宜:聪明的“差异化”训练策略
大模型面对的文本特征千差万别,用一套方法打天下显然不够高效。AngelSpec 采用了“看菜下饭”的差异化训练策略,针对不同场景精准发力:
- 高熵开放式对话:针对多轮对话这种发散性强、不确定性高的任务,系统采用了轻量且稳定的多 token 预测机制(MTP),并巧妙结合了训练时测试(TTT)与端到端总变差损失。这使得模型能够极其平滑地适应自回归展开中的状态分布。
- 代码与数学推理:面对逻辑严密、结构约束更强的任务,AngelSpec 则祭出了专有的块扩散模型进行强化训练,深度挖掘长跨度可预测序列的潜力,让代码和公式的生成又快又准。
架构创新:DFly 框架与动态验证机制
在底层架构设计上,AngelSpec 提出了一个名为 DFly 的创新块扩散框架,从两个维度实现了效率跃升:
- 高吞吐与高利用率的完美融合:DFly 巧妙混合了“目标条件编码骨干”与“前序条件自回归头”。这种设计在维持高吞吐量并行生成的同时,大幅拉升了目标特征利用率,并优化了块内依赖建模能力。
- 聪明的动态验证机制:系统引入了自适应调整机制,能够根据当前的在线负载、硬件状态以及前缀置信度,在运行时动态调整验证深度。这就好比汽车的自动变速箱,在计算资源消耗与吞吐效率之间找到了最佳平衡点。
实测表现:Hy3 模型上的性能狂飙
纸上得来终觉浅,实战表现才是硬道理。在 Hy3 模型系列的系统测试中,搭载 DFly 方案的 AngelSpec 交出了一份极其亮眼的成绩单:
在并发数从 4 到 64 的全场景压测中,该方案均斩获了最高的平均吞吐量。相比传统的自回归解码,其性能提升极为显著,为大模型的工程化落地与高效推理提供了极其坚实的开源基建支持。
探索与贡献
AngelSpec 的开源,标志着大模型推理优化进入了更精细化、场景化的新阶段。对于开发者与研究人员而言,这无疑是一个值得深入研究的利器。
- 项目开源地址:GitHub – Tencent/AngelSpec
- 技术论文详情:arXiv 论文 PDF
