DeepSeek新技术移植苹果芯片,Mac本地大模型加速60%
DeepSeek开源的DSpark技术已被开发者Abdur Rahim成功移植到苹果芯片Mac上,推出了名为mlx-dspark的本地版本。该版本适配了Gemma-4 12B和Qwen3-4B模型,在M4 Pro芯片上分别实现了约1.6倍和1.4倍的生成速度提升。
DSpark的核心思路是使用一个小型“草稿模型”预先生成多个候选词,再由主模型批量核对与接受,以此加速推理过程。Rahim针对苹果芯片的内存访问特点优化了成本模型,并实现了完整的温度采样方法,确保了输出结果与原始模型逐字节完全相同,在提速的同时未损失生成质量。
此外,项目还集成了另一项投机解码技术DFlash。DFlash采用“块扩散”方式并行生成16个token,在代码和数学任务上表现更优,速度可达约2.1倍。但对于开放域聊天等难以预测的内容,其接受长度不足,优势受限。因此,mlx-dspark的最新版本允许用户根据任务类型动态调整DFlash的块长度,从而灵活兼顾聊天与代码等不同场景的需求。
该项目已开源,未来有望支持更大的模型,为Mac本地大模型推理提供了高效的加速方案。
marsbit07/03 12:22