技术博文:推测解码:它如何演进、何时保持无损,以及下一步走向何方地址:neurips2026-speculative-decoding.vercel.app/
大语言模型通常逐 token 生成文本,每生成一个 token 都要运行一次目标模型,因而解码速度受到串行过程限制。推测解码让较小的“草稿模型”先提出一组候选 token,再由目标模型一次并行验证。
这是一份兼具技术综述、实验报告和动手教程的推测解码教材。文章首先把推测解码的加速效果归结为三个因素:草稿时间、验证时间和平均接受长度;随后以四代方案说明技术演进:EAGLE-3 利用目标模型的多层特征并通过训练时展开提高候选准确率,DFlash 用块扩散一次并行生成整段草稿,DSpark 通过置信度调度减少无效验证,DFlash 2 则用并行路径选择器和局部卷积改善块内连贯性。
文章更重要的部分是对“无损”的拆解:严格拒绝采样只能保证理论上的分布一致;降低接受阈值、让调度器偷看后续候选,会直接引入分布偏差;即使算法正确,部署中的数值误差、量化、KV 缓存压缩和不同计算内核仍可能使输出分叉。
作者据此提出 LosslessBench,将评测从常见的数学、代码和聊天扩展到前端设计、创意写作、安全防护、编程代理和长程代理任务。初步结果显示,不同领域的接受长度和速度收益差异很大,而且“草稿与目标模型高度一致”并不代表最终任务质量更好:例如 DFlash 在前端任务中速度最快却生成了损坏页面,在创意写作中反而写出了评价最高的故事。文章最后给出基于 Qwen3-8B、vLLM、Modal 和 DeepSpec 的复现实验,并把多模态推测解码、提前执行代理工具调用列为下一阶段方向。
