讨论精选
recro69 (0↑): 如果这个功能很快出现在 llama.cpp 或 vLLM 中,那才是我兴奋的时候
conockrad (0↑): 它已经在 vLLM 中了——两天前合并的
agentzappo (0↑): 算不上什么重大变化。它只是修订版的推测解码,建立在与 EAGLE-3、MTP、DFlash 等相同的原理之上。 TL;DR 他们的方法是使用一个并行起草器,用一个微小的顺序头来修补其后期 token 的薄弱行为,然后通过仅验证在当前负载下看起来有价值的 prefix 长度来避免浪费验证能力。它在这些较大模型的上下文窗口早期有效,但随着上下文变长,接受率会下降。
这是很酷的工作,但我不会称其为像推测解码刚出现时那样的“巨大突破”。