2026-06-30-星期二 · DeepSeek

收录于 第 18 期(2026-06-30) · 本期共 10 条

❯ DeepSeek 开源 DSpark 投机解码框架,V4 推理最高提速 85%

框架开源DeepSeek 于 6 月 27 日发布并开源 DSpark——一套面向 DeepSeek-V4 的投机解码框架,称可把单用户生成速度提升 60% 到 85%(V4-Flash),Pro 版提升 57% 到 78%。它不是新模型,而是叠在现有 V4 检查点之上的工程优化,以 MIT 许可证开源,并已在 V4-Flash 和 V4-Pro 上线。

怎么做到的DSpark 用的是 DeepSeek 称为“半并行”的方法:与其一个 token 一个 token 地生成再逐个校验,不如同时投机式生成多个候选 token,再有选择地只验证那些有把握的猜测,把高吞吐并行生成和自适应校验结合起来。DeepSeek 还一并开源了训练和评估草稿模型的代码库 DeepSpec。按官方对比,相较 Eagle3,在三档 Qwen3 模型上的宏平均接受长度分别提升 30.9%、26.7%、30.0%;框架也在谷歌的 Gemma 系列上做了验证。投机解码本身不是新概念,但 DeepSeek 把它打包成可直接复用的开源工具链,降低了门槛。

谁要重算对自建推理服务、又被算力和成本卡脖子的团队,DSpark 给出的是一条”不换模型也能提速”的现成路径——同样的卡、同样的权重,吞吐和延迟却能改善一大截。真正被松动的是推理侧的单位成本:当一套开源框架就能把 V4 的生成速度抬高近一倍,自部署相对调 API 的性价比账要重算。接下来要看的是这套框架在 Gemma、Qwen 之外的第三方模型上能否同样跑出收益。

signal: 不动模型权重就把推理提速近一倍,DeepSeek 把降本的战场推到了工程优化层。