返回 文章 apply CMS 文章

分布感知推测解码:将强化学习展开速度提升高达50%

DAS是一种免训练的推测解码框架,利用RL训练中的历史轨迹和长度感知调度,显著加速生成阶段。

强化学习推测解码生成加速后缀树
成长分 / 100 79 综合收获、行动、留存与影响

分布感知推测解码:将强化学习展开速度提升高达50%
为什么值得读了解RL后训练中生成瓶颈的根本原因(长尾分布、同步屏障、GPU空闲)。

学习一种无需额外训练、可自适应策略变化的草稿模型设计。

关键洞察
  1. RL后训练中70%的时间消耗在生成阶段,且受长尾生成主导。
  2. DAS使用基于后缀树的免训练草稿模型,从历史轨迹中动态构建,无需梯度更新。
  3. 长度感知调度通过跨GPU交错长请求和GPU内分类预算分配,减少落后者。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:7514

蓝色抽象几何形状背景上写着“分布感知推测解码”的图片。

摘要

分布感知推测解码(DAS)是一种新颖的框架,能够显著缓解强化学习后训练中的生成瓶颈——在不影响模型输出的情况下,实现高达 50% 的加速。

生成瓶颈

强化学习已成为现代大语言模型后训练的基石。像 DeepSeek-R1 这样的模型,其推理能力归功于强化学习微调。但随着模型规模增大,一个关键瓶颈出现了:生成阶段。

在强化学习训练中,模型必须为批次中的每个提示生成完整响应,然后才能开始下一步训练。最慢的生成决定了总步长时间——这是一个典型的长尾问题。

70% 的总训练时间消耗在生成阶段——超过了反向传播和参数更新的成本总和。

  • 同步屏障:所有生成必须完成后才能继续训练。一个慢生成会阻塞整个批次。
  • 长度增长:现代推理模型生成越来越长的思维链,放大了长尾效应。
  • GPU 空闲时间:当落后者运行时,其他 GPU 闲置——每次训练运行浪费数千美元的计算资源。

关键洞察

强化学习后训练中的生成阶段具有三个结构特性,使其区别于标准的大语言模型服务负载。这些特性推动了 DAS 的核心设计选择。

长尾生成导致 GPU 利用率不足:强化学习生成遵循长尾分布:大多数生成快速完成,而少数生成产生极长的轨迹。由于训练步骤必须等待所有生成完成,这些长序列成为决定步骤延迟的落后者。当较短的请求提前完成时,GPU 变得空闲,导致严重的硬件利用率不足。历史轨迹信号:与服务(唯一请求)不同,强化学习训练会在多个 epoch 中重复使用相同的提示——从而产生丰富的先前生成历史可供利用。模型权重演变:模型在每个优化器步骤后都会变化。基于早期检查点训练的静态草稿模型会迅速与当前策略失配。

DAS 框架

每个特性都指向一个设计需求:

  • 一个无需重新训练就能保持最新的草稿模型
  • 一个能消除落后者的调度器,以及
  • 一个利用强化学习特有的提示重用的系统。

DAS 通过两个紧密集成的组件解决了所有三个问题。第一个是自适应后缀树草稿模型,它能加速生成并在长时间训练范围内优雅地扩展。第二个是长度感知调度策略,通过 GPU 间负载均衡和 GPU 内推测预算分配来减少生成落后者。

自适应后缀树草稿模型

为什么用后缀树?

随着策略在强化学习训练过程中演变,静态草稿模型会迅速过时。因此,DAS 使用基于最近生成的免训练草稿模型,从而无需任何梯度更新即可持续适应变化的策略。

工作原理

DAS 从最近轨迹的滑动窗口中构建后缀树。在解码过程中,它找到当前上下文与索引历史之间的前缀匹配。然后,候选的下一个 token 根据其在匹配子树中的频率进行评分,得分最高的 token 被选为推测草稿。

为何适合 RL 展开

草稿序列由目标模型并行验证,新验证的 token 会立即插回树中,使草稿模型始终与最新策略保持同步。由于 RL 展开通常包含强烈的轨迹重用,这种非参数化设计可以有效利用重复的前缀,而无需单独的神经草稿模型。

可扩展性

后缀树在展开前构建,并在每个训练步骤后释放,因此内存不会在长时间的训练过程中累积。树的构建和清理按问题并行化,并与 actor 更新重叠,导致 actor 更新延迟的波动小于 5%,使开销远离关键路径。

长度感知调度

GPU 间平衡

DAS 跨 rank 交错处理长请求。这防止了长生成集中在单个工作节点上,并减少了展开中的掉队者。

长请求的早期推测

DAS 从展开开始就对长请求应用推测解码。展开延迟主要由少数存活到后期阶段的长掉队者主导,此时解码变为小批量且强烈受内存限制。在这些请求上早期投入额外计算是值得的——它避免了昂贵的后期模型前向传播,并缩短了展开尾部。

GPU 内预算分配

在每个 GPU 内,请求根据历史展开统计动态划分为长、中、短三类。长请求获得激进的推测解码预算,中等请求使用适度预算,短请求完全跳过推测——避免了在推测无法减少模型前向传播的情况下浪费计算。这种分类策略在运行时动态更新。

这个设计简单到可以用几段话来描述。结果验证了它的有效性。

实验结果

DAS 在两个 RL 后训练任务——数学推理和代码生成上进行了评估。在这两种情况下,关键的指标是在不降低奖励质量的前提下减少展开时间。

数学 RL — DeepSeek-R1-Distill-Qwen-7B

DSR-sub 数据集(1,209 个示例)。DAS 实现了超过 50% 的展开时间减少,同时完全匹配基线奖励曲线。

代码 RL — Qwen3-8B

单元测试奖励信号。DAS 实现了约 25% 的展开时间减少,同时保持了奖励质量。

柱状图显示展开加速:数学 RL 7B 为 50%,代码 RL 8B 为 25%,代码 RL 8k 序列为 30%。

为何重要

DAS 提供了三个很少同时出现的特性:

无损加速:DAS 保持分布不变——与标准解码输出相同,训练曲线相同。跨配置鲁棒:加速效果在序列长度(8k–16k)和批大小(16–32)上均成立。零成本适配:后缀树草稿模型从 rollout 历史中自我进化。无需梯度更新,无需维护。

随着 AI 社区推动在日益复杂的任务上使用强化学习训练更大规模的模型,rollout 瓶颈只会变得更加严重。对于大规模进行 RL 后训练的从业者来说,DAS 提供了一条引人注目的路径,可将计算成本降低高达 50%,且模型质量不下降——在资源受限的大规模 AI 训练世界中,这是一种罕见的双赢。

阅读论文了解更多。