免费获取学习方案
ARTICLE DETAIL

资讯详情

深耕编程基础知识与建站技术分享的一线实战洞察。

DFlash2 深度解读:让 Speculative Decoding 继续并行下去

DFlash2 深度解读:让 Speculative Decoding 继续并行下去 TL;DR:Speculative decoding 的核心收益来自“用一次 target model verification 接受更多 token”。DFlash 把 draft 阶段从逐 token 自回归改成 block-level 并行预测;DFlash2 进一步补上两个短板:用Path Selector从 top-k 候选中选出更连贯的 token 路径,用Local Convolution缓解 draft block 后缀位置质量下降。它的关键价值不是引入一个更重的草稿模型,而是在几乎不破坏并行性的前提下,提高 acceptance length。1. 推理加速的主战场,正在从“小优化”转向 speculative decodingLLM 在线推理的麻烦,不在于 prefill 一定慢,而在于 decode 天然串行。Prefill 阶段处理用户输入,多个 prompt token 可以并行进入模型;decode 阶段则不同,模型必须先生成第t个 token,才能把它作为上下文继续生成第t+1个 token:x 1 → x 2 → x 3 → x 4 → ⋯ x_1 \to
返回列表