返回 讨论 学习 CMS 文章

DeepSeek 发布 DSpark:比 MTP 更快的推测解码新方法

DeepSeek 的 DSpark 是一种基于推测解码的优化方法,通过并行起草器和动态验证提升推理速度。

DeepSeekDSpark推测解码推理加速
成长分 / 100 54 综合收获、行动、留存与影响

为什么值得读了解 DeepSeek 在推理加速方面的最新进展

对比 DSpark 与 MTP、EAGLE-3 等方法的异同

关键洞察
  1. DSpark 使用并行起草器,并用微小顺序头修补后期 token 的薄弱行为
  2. 通过仅验证当前负载下有价值的 prefix 长度来避免浪费验证能力
  3. 在较大模型的上下文窗口早期有效,但随着上下文变长,接受率下降
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:800

讨论精选

recro69 (0↑): 如果这个功能很快出现在 llama.cpp 或 vLLM 中,那才是我兴奋的时候

conockrad (0↑): 它已经在 vLLM 中了——两天前合并的

agentzappo (0↑): 算不上什么重大变化。它只是修订版的推测解码,建立在与 EAGLE-3、MTP、DFlash 等相同的原理之上。 TL;DR 他们的方法是使用一个并行起草器,用一个微小的顺序头来修补其后期 token 的薄弱行为,然后通过仅验证在当前负载下看起来有价值的 prefix 长度来避免浪费验证能力。它在这些较大模型的上下文窗口早期有效,但随着上下文变长,接受率会下降。

这是很酷的工作,但我不会称其为像推测解码刚出现时那样的“巨大突破”。