
transcript
show notes
DSpark 是一种由 DeepSeek 团队研发的新型投机采样解码(Speculative Decoding)框架,旨在提升大语言模型的推理速度。该框架采用半自回归架构,结合了并行生成的高效率与自回归模型的高准确性,有效解决了传统并行草稿模型中后期预测质量下降的问题。为了进一步优化系统吞吐量,DSpark 引入了置信度调度验证机制,能够根据系统负载和预测准确概率动态调整验证长度。这种硬件感知的调度策略避免了在高并发场景下浪费计算资源。在 DeepSeek-V4 系统的实际部署中,DSpark 在保持相同吞吐能力的同时,将单用户生成速度提升了 60% 至 85%。总之,该技术通过“更优质的草稿”和“更智能的验证”,成功突破了大型模型在线推理的性能瓶颈。