前途科技前途科技
  • 洞察
  • 服务
  • 关于
  • AI 资讯
    • 快讯
    • 产品
    • 技术
    • 商业
    • 政策
    • 初创
  • 洞察
  • 资源中心
    • 深度研究
      • AI 前沿
      • 案例研究
      • AI 知识库
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
AI 前沿/08.25 · 09:02/5 MIN/编译自 零壹界点/0 阅读

DeepSeek 放出 DSpark:V4 推理速度暴增 400%

谁干的?怎么干的? 但真正狠的在线上。 生产环境:从 51% 到 400% 论文第 5 章是把 DSpark 部署到 DeepSeek V4 真实服务集群后的实测数据。 在 V4-Fl

                    <div class="detail-content-box has-mask large">
                        <section powered-by="xiumi.us" style="-webkit-tap-highlight-color: rgba(0, 0, 0, 0);margin: 0px;padding: 0px 5px;outline: 0px;white-space: normal;background-color: rgb(255, 255, 255);text-align: center;font-size: 12px;font-family: PingFangSC-light;letter-spacing: 2px;visibility: visible;">

谁干的?怎么干的?

但真正狠的在线上。

生产环境:从 51% 到 400%

论文第 5 章是把 DSpark 部署到 DeepSeek V4 真实服务集群后的实测数据。

在 V4-Flash 引擎上:

  • 中等交互要求(80 tok/s/用户)下,系统总吞吐量提升 51%
  • 严格交互要求(120 tok/s/用户)下,MTP-1 基线已经撑不住了,DSpark 相对提升 661%——主要是基线自己掉到地板了,DSpark 勉强撑住了
  • 在匹配吞吐量下,单用户生成速度提升 60% 到 85%

在 V4-Pro 引擎上:

  • 中等 SLA 下吞吐量提升 52%
  • 严格 SLA 下相对提升 406%
  • 单用户速度提升 57% 到 78%

(原文:"DSpark shifts the Pareto frontier of LLM serving outward.")

翻译成人话:以前 V4 在高并发下为了保证交互速度,只能牺牲吞吐量;现在 DSpark 把整条「速度 vs 吞吐」的边界往外推了一截。

怎么做到的?关键在那套动态调度。并发请求少的时候,调度器给每个请求分配较长的验证预算(4-6 个 token);并发一上来,自动收紧预算——不让低把握的 token 抢 GPU。这套机制在生产环境跑通了,而且没有引入额外的调度延迟(用了异步+ZOS 集成)。

开源了什么?怎么上手?

DSpark 的训练代码、checkpoint、论文全部公开。

GitHub 仓库 DeepSpec 是一个完整的投机解码训练框架,包含三种算法:DSpark、DFlash、Eagle3。目前 1,836 star,MIT 协议。

三条路跑起来

如果你只是想用现成的加速效果:

V4 用户什么都不用做。DSpark 已经替代了 MTP-1,部署在 DeepSeek V4 的生产服务端。你感受到的"

标签:AI

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

会打字,就能"拍"电影:ScriptTask 开放限量内测
置顶

会打字,就能"拍"电影:ScriptTask 开放限量内测

//

24小时热榜

TOP1

为什么DeepSeek Harness选择了Cordis作为Agent的内核?

DeepSeek Harness 源码深潜(上)——从 API 到 Agent 心脏(附源码)
前途科技前途科技
服务关于快讯技术商业报告
前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款
V4 好像变快了
"
——不是错觉。

如果你想给 Qwen/Gemma 接上 DSpark:

DeepSeek 在 HuggingFace 上发布了已训练好的 checkpoint,直接覆盖 Qwen3-4B/8B/14B 和 Gemma4-12B:

  • deepseek-ai/dspark_qwen3_4b_block7
  • deepseek-ai/dspark_qwen3_8b_block7
  • deepseek-ai/dspark_qwen3_14b_block7
  • deepseek-ai/dspark_gemma4_12b_block7

每个 checkpoint 都是对应目标模型的 draft model,接上就能用。

如果你想自己训练草稿模型:

DeepSpec 仓库提供了完整的训练管线:

# 1. 安装依赖
python -m pip install -r requirements.txt

# 2. 准备数据(下载 + 用目标模型重新生成答案)
# 详见 scripts/data/README.md
# 注意:默认 Qwen3-4B 设置下缓存约 38TB

# 3. 训练
bash scripts/train/train.sh
# 通过 config_path 选择算法和模型,例如:
# config/dspark/dspark_qwen3_4b.py

# 4. 评估
bash scripts/eval/eval.sh
# 设置 target_name_or_path 和 draft_name_or_path

配好之后,每次使用只需要做一件事:用训练好的 draft checkpoint 替代原来的 draft model,推理框架会自动跑投机解码流程。

训练默认配置假设单机 8 卡。卡少的话调 CUDA_VISIBLE_DEVICES。

最容易出错的地方在数据准备阶段——目标模型重新生成答案时缓存可能极大(默认 38TB)。建议先拿小数据集验证流程跑通,再上全量。

核心概念速查

  • DSpark:半自回归草稿模型,并行骨架 + Markov Head 串行修正
  • DFlash:纯并行草稿模型(DSpark 的骨架就是基于它)
  • Eagle3:自回归草稿模型,采用 TTT(Training-Time Test)
  • Confidence Head:预测每个 draft token 被接受的概率
  • Hardware-Aware Prefix Scheduler:根据系统负载动态决定验证几个 token

重点:DSpark 真正适合的是有推理服务部署需求的团队——不管是自建还是用 DeepSeek 的 API,本质收益都是"同样的硬件,服务更多人,响应更快"。


DeepSpec GitHub:https://github.com/deepseek-ai/DeepSpec

DSpark 论文:https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

HuggingFace Checkpoints:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark

点赞、转发、小心心 ❤️ 欢迎在评论区留下你的想法!

— 完 —


免责与版权声明:本文资讯及观点仅供技术交流参考。文中引用图片均源于网络公开渠道(如官方博客、社交平台等),著作权归原作者所有。本文旨在分享与评述技术进展,符合“合理使用”原则。如相关图片/内容涉及版权侵权,请联系我们(留言或私信),我们将核实后立即删除。

登录查看剩余 70% 内容
TOP2

DeepSeek Harness 源码深潜(上)——从 API 到 Agent 心脏(附源码)

3

DeepSeek Harness 源码深潜(中)——工具、提示词与插件内核(附DSH源码)

47分钟前
DeepSeek Harness 源码深潜(中)——工具、提示词与插件内核(附DSH源码)
4

DeepSeek Harness只需装这一个插件即可

48分钟前
DeepSeek Harness只需装这一个插件即可
5

Huashu-Excel正式发布!可能、也许、大概是最好用的Excel数据处理和分析skill

48分钟前
Huashu-Excel正式发布!可能、也许、大概是最好用的Excel数据处理和分析skill
6

DeepSeek Harness规模化踩坑实录:耗时、成本、失败到底该怎么查

48分钟前
DeepSeek Harness规模化踩坑实录:耗时、成本、失败到底该怎么查
7

19 万 Star 之后,我给 DeepSeek Harness 接入了Milvus

49分钟前
19 万 Star 之后,我给 DeepSeek Harness 接入了Milvus
8

RAG处理表格数据——Table RAG让我把Excel变成了知识库

49分钟前
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断