刚刚,DeepSeek V4更新DSpark,推理速度提升80%
DeepSeek-V4-Pro-DSpark版本已更新,通过引入推测性解码框架DSpark大幅提升推理速度。该版本并非架构革新,而是在原有模型基础上加入推测性解码模块,重点在于工程优化。
DSpark采用了创新的半自回归生成架构,结合了并行草稿模型的高吞吐优势和串行模块的精准依赖建模。同时引入硬件感知的置信度调度验证机制,动态调整验证长度,将算力集中在高价值token上。在真实线上部署中,DSpark通过异步调度器实现了零开销调度和连续CUDA图回放。
测试显示,在Qwen3系列模型上,DSpark的平均接受长度比Eagle3提升26.7%-30.9%,比DFlash提升16.3%-18.4%。与单token生成基准相比,DSpark将用户生成速度提升了60%-85%(Flash模型)和57%-78%(Pro模型)。
随DSpark一同开源的还有全栈推测性解码框架DeepSpec,提供了从数据准备、训练到评估的完整工具链,支持多种草稿模型算法和目标模型系列,为研究者提供了可复现的标准化开发环境。
marsbit06/27 08:52