前途科技前途科技
  • 服务
  • 关于
  • AI
    • AI 大模型
    • 具身智能
    • 算力芯片
  • 科技
    • 智能终端
    • 软件·互联网
    • 汽车·出行
    • 科学前沿
  • 资源中心
    • 深度研究
      • AI 前沿
      • 教程
      • AI 知识库
      • 案例研究
    • 行业报告
      • 白皮书
      • 行业报告
      • 研究报告
      • 技术分享
      • 专题报告
    • 精选案例
      • 金融行业
      • 医疗行业
      • 教育行业
      • 零售行业
      • 制造行业
  • 服务
  • 关于
联系我们
教程/09.28 · 09:43/12 MIN/作者:苏晚/0 阅读

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

Liquid AI 把 DSpark 投机解码扩展到视觉语言模型,端侧解码最高提速 3.13 倍,但端到端最低只有 1.56 倍。用它自己的基准数据反推解码占比,能得到一条比「最高多少倍」有用得多的选型规则:收益由输出长度决定,不由草稿模型决定。

Liquid AI 在 2026 年 9 月 24 日于 Hugging Face 博客发表了《Accelerating vision-language models with LFM2.5-VL-DSpark》(原文:https://huggingface.co/blog/LiquidAI/lfm2-5-vl-dspark),宣布把自家的 DSpark 投机解码草稿模型扩展到视觉语言模型(VLM)上,并为 llama.cpp、MLX-VLM、SGLang 三套推理栈提供发布即可用的支持。

标题上的数字很好看:端侧解码最高提速 3.13 倍,H100 上最高 2.66 倍。但同一篇文章里还有另一组数字——端到端最低只有 1.56 倍。同一台 M5 Max、同一个草稿模型、接受率几乎相同,端到端却能从 2.62 倍掉到 1.56 倍。

这个落差才是这篇发布里最值得花时间的部分。它决定了你把这套东西搬到自己的业务上之后,宣传页上的倍数还能剩下多少。下面先把原文的技术细节和实测数据讲清楚,再用它自己的数据反推一个可以直接拿去做选型的算法。

一、DSpark 挪到 VLM 上,改动比想象中少

投机解码的基本盘是:用一个小得多的「草稿模型」一次性猜出若干个 token,再让真正的「目标模型」并行校验,猜对的批量接受,猜错的丢弃重来。省下来的是目标模型逐 token 串行前向的次数。

DSpark 的做法是让草稿模型直接吃目标模型的隐状态。按原文描述,视觉版草稿模型和文本版 LFM2.5-DSpark 草稿模型用的是同一套架构:在目标模型固定的若干「抽取层」上取隐状态,以此为条件起草一个长度为 k 的候选 token block。

关键在于,图像 patch 和文本 token 在进入这些层之前,已经被投影到同一个共享表示空间里,草稿模型拿到的隐状态向量维度与输入模态无关。原文因此给出了一个很干脆的结论:推理算法相对文本版完全没有改动。

DSpark 在视觉语言模型上的工作流程示意

左侧目标模型把图像 patch 与文本 token 一同编码,通过 KV Injection 把隐状态交给右侧草稿模型;草稿模型并行产出一个 block 的候选 token(E/F/G/H),再由目标模型校验,图中前三个被接受、第四个被丢弃。图片来源:Liquid AI / Hugging Face Blog

这一点对工程判断很重要:它意味着 VLM 的投机解码不需要为视觉模态单独设计一套验证逻辑,已有的文本投机解码实现只要能接住多模态输入,改造量就是可控的。原文所说的「发布即支持三套推理栈」之所以能做到,前提正在这里。

二、规格:4 层、block size 9、多出 8.9% 参数

训练上,Liquid AI 沿用 DSpark 的配方,用视觉-语言 SFT 数据混合训练,配比向他们预期这个模型要承接的工作负载倾斜。草稿模型的层数是做过消融的——在 3 层、4 层、5 层之间比较后,最终选了一个只保留注意力(attention-only)的 4 层结构,block size 定为 9。

训练跑了 10 个 epoch,每个 epoch 之后测一次接受率。原文说接受率随训练 token 增加而提升,但很快进入收益递减。推理时的推荐值是 block size 8 或 9,具体取决于硬件。

代价方面,这个草稿模型约 2.8 亿(280M)参数,相对 3B 的目标模型只增加了 8.9% 的部署参数量。这个比例值得单独记一下:它意味着在显存吃紧的端侧设备上,投机解码不是一个「再塞进去一个模型」量级的开销,而是接近于把目标模型放大了不到一成。

三、三套栈的实测:解码提速与端到端提速是两回事

原文的基准配置是:两套部署都用 block size 8,覆盖六类视觉任务——通用 VQA、文本 VQA、图像描述、图表 VQA、复杂推理、多轮对话,遵循 MMSpec 基准。

端侧部分,MLX 跑在 M5 Max 上,解码提速 2.30 倍到 3.13 倍,端到端 1.56 倍到 2.62 倍;llama.cpp 跑在 M3 Ultra 上,解码提速 1.57 倍到 2.14 倍,端到端 1.30 倍到 1.77 倍。

LFM2.5-VL-3B-DSpark 端侧推理实测

上半部分为 Apple M5 Max + MLX,下半部分为 Apple M3 Ultra + llama.cpp。浅灰为 prefill,深灰为基线解码,紫色为 DSpark 解码;右侧三列依次是端到端提速、解码提速与平均接受 token 数。图片来源:Liquid AI / Hugging Face Blog

GPU 部分,同一个草稿模型在 H100 80GB 上的端到端提速为 1.64 倍到 2.27 倍。这里有一处需要提醒:原文正文把 H100 的解码提速区间写成了「20.4x to 2.66x」,而对应的图表里 H100 解码提速的最低值出现在多轮对话任务上,标注为 2.04x——正文那个 20.4 应是 2.04 的笔误,引用时不要照抄。

LFM2.5-VL-3B-DSpark 在 H100 上的推理实测

NVIDIA H100 80GB HBM3 + SGLang 的六项任务结果,图例与上图一致。COCO 任务上解码提速 2.66 倍、端到端 2.27 倍,接受 token 数 4.57 为全表最高。图片来源:Liquid AI / Hugging Face Blog

四、为什么接受率差不多,端到端却差一倍

苏晚
苏晚Su Wan

前途科技 · 前沿主笔

关注 AI 与前沿科技的观察者,前途科技前沿内容主笔。

查看全部文章

想了解 AI 如何助力您的企业?

免费获取企业 AI 成熟度诊断报告,发现转型机会

置顶文章

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板
置顶

解码快 3.13 倍,端到端只有 1.56 倍:VLM 投机解码的天花板

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误
置顶

把 MuJoCo 搬上 GPU:MJWarp 迁移的四道闸门与三种不报错的错误

前途科技前途科技
服务关于快讯技术商业报告
微信咨询二维码

咨询微信

扫码添加微信咨询

前途科技微信公众号

微信公众号

扫码关注

Copyright © 2026 AccessPath.com, 前途国际科技咨询(北京)有限公司,版权所有。|京ICP备17045010号-1|京公网安备 11010502033860号|隐私政策|服务条款

原文对这件事给了正确但笼统的解释:投机解码只加速 decode,不加速视觉编码和 prefill;当这两段本来就占了大部分墙钟时间,再大的解码提速也只换来有限的端到端收益——这是阿姆达尔定律。原文还补充说,VLM 的 prefill 比纯文本更重,因为图像要先过视觉编码器,语言主干再处理几百个视觉 token;而端侧设备算力远低于数据中心 GPU,prefill 占比会更高(M5 的每核 GPU 神经加速器缩小了这个差距)。

这段解释是对的,但它停在了定性层面。而这两张图给的数据足以把它变成一个可以算的量。阿姆达尔定律的形式是:端到端提速 = 1 / ((1 − f) + f / s),其中 s 是解码提速,f 是解码在原始墙钟时间里的占比。两个已知量解一个未知量,f 就能反推出来:

f = (1 − 1/端到端提速) / (1 − 1/解码提速)

把图里的数据代进去,结果相当有说服力:

平台与任务解码提速端到端反推解码占比
M5 Max + MLX,MMMU-Pro2.93x2.62x约 94%
M5 Max + MLX,COCO3.13x2.59x约 90%
M5 Max + MLX,CharXiv2.94x1.71x约 63%
M5 Max + MLX,TextVQA2.69x1.56x约 57%
M3 Ultra + llama.cpp,GQA1.77x1.30x约 53%
H100 + SGLang,COCO2.66x2.27x约 90%
H100 + SGLang,TextVQA2.14x1.64x约 73%

看 M5 Max 上的 COCO 与 TextVQA 这一对:接受 token 数分别是 4.21 和 4.08,几乎一样;解码提速 3.13 倍对 2.69 倍,差距也不大。但端到端一个 2.59 倍、一个 1.56 倍。差别不在草稿模型猜得准不准,而在这两类任务的输出长度——图像描述要生成整段文字,解码占了九成墙钟时间;而 TextVQA 是看图回答一个短问题,输出没几个 token,超过四成的时间花在视觉编码和 prefill 上,投机解码碰都碰不到。

这条推论给出的选型规则,比「最高提速 3.13 倍」有用得多:投机解码的收益由你的输出长度决定,而不是由草稿模型的质量决定。长输出任务——文档结构化抽取、图表解读成段落、多轮视觉问答、长图文摘要——是这套东西的主场;短输出任务——图片打标、是非判断、单字段 OCR 校验、审核分类——几乎吃不到红利,哪怕接受率同样漂亮。

同一张表还能看出第二件事。M3 Ultra 上 COCO 的接受 token 数是 4.50,比 M5 Max 上同一任务的 4.21 还高,解码提速却只有 2.14 倍对 3.13 倍。接受率更高而提速更低,说明瓶颈不在草稿模型,而在运行时与硬件本身——同一个草稿模型换一套栈、换一代芯片,收益可以差掉三分之一。这也是为什么原文推荐 block size「8 或 9,取决于硬件」而不是给一个固定值。

五、它是无损的,而且自带可观测性

有一点必须说清楚,因为这是投机解码区别于量化、蒸馏这类提速手段的根本:它是精确的。目标模型会校验每一个被提议的 token,所以在贪心解码下,输出与不用草稿模型时完全一致。你不是在拿质量换速度,你是在拿显存换速度。

原文还提到了一个容易被忽略但很实用的细节:每次响应的计时报告里会给出 draft_n 与 draft_n_accepted。这两个数就是线上监控投机解码是否还在正常工作的抓手——接受率一旦掉下来(比如换了 prompt 模板、换了图像分辨率、业务流量分布漂移),提速会先于任何报错悄悄消失。上线时就把这两个指标接进监控,比事后查「为什么最近变慢了」省事得多。

六、三套栈怎么跑起来

SGLang 需要带 DSpark for LFM2 支持的构建(PR #40651),启动目标模型时挂上草稿模型:

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

随后在 http://localhost:30000/v1 访问 OpenAI 兼容接口。block size 从草稿模型的 config.json 里读取。这里有一个做基准测试时必须照做的细节:基线就是同一条命令去掉那三个 --speculative-* 参数——同样的构建、同样的目标模型、同样的缓存设置,只切换投机解码这一个变量。拿别的框架或别的配置当基线,测出来的倍数不成立。

llama.cpp 需要对应的构建(PR #29339):

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

MLX-VLM 需要对应的构建(PR #2280),命令最短:

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

MLX 这边的 block size 从随模型附带的 sidecar 元数据里读,n-max 会被钳制到该值。草稿模型在 Hugging Face 上同时提供 Safetensors 与 GGUF 两种格式,权重开放,可下载、可微调、可自行部署。

七、落到中国团队的部署清单上

第一件事是改掉提问方式。向供应商或内部平台要性能数据时,别问「投机解码能快多少倍」,要问「在我这类任务的输入输出长度下,端到端能快多少倍」。这两个问题的答案在 M5 Max + TextVQA 这一格里差了将近一倍,而前者是所有宣传材料默认会回答的那个。

第二件事是先量自己的 decode 占比。不需要先接草稿模型:跑一批真实请求,记录 time-to-first-token 与总耗时,两者之差就近似是解码段。占比低于六成,投机解码的端到端收益大概率压在 1.5 倍以内;高于九成,才有机会吃到接近解码提速的全部红利。这个测量在任何推理栈上都能做,不依赖 DSpark。

第三件事是算显存账。8.9% 的额外参数在 H100 上不值一提,但在把 3B VLM 塞进消费级设备的场景里,这一成可能正好是压垮 KV cache 预算的那部分。端侧选型时要把草稿模型的常驻显存和 block size 带来的临时开销一起算进去,而不是只算目标模型。

第四件事是别把 prefill 的账算到投机解码头上。VLM 的图像 token 数量由分辨率和切片策略决定,几百个视觉 token 过一遍语言主干的成本是实打实的。如果你的瓶颈在这里,该做的是降分辨率、裁切 ROI、复用图像编码结果,而不是换一个更好的草稿模型——阿姆达尔定律封死的那部分,换草稿模型是换不出来的。

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算
置顶

解码快 3 倍,端到端只快 1.5 倍:VLM 推测解码 DSpark 的账怎么算

//

24小时热榜

Anthropic旗下Claude自主发现类CRISPR新酶系统
TOP1

Anthropic旗下Claude自主发现类CRISPR新酶系统

TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解
TOP2

TikTok与阿拉巴马州就青少年成瘾指控达成至少1亿美元和解

3

两项新研究证实土卫二具备探测生命迹象的潜力

20小时前
两项新研究证实土卫二具备探测生命迹象的潜力
4

波音737 MAX曝软件故障:降落时或致自动驾驶失效

21小时前
波音737 MAX曝软件故障:降落时或致自动驾驶失效
5

SpaceX 16天内发射第三次美太空军机密任务

21小时前
SpaceX 16天内发射第三次美太空军机密任务
6

未经专属训练,GPT-6 Astra 成功控制真实汽车跑完全程

21小时前
未经专属训练,GPT-6 Astra 成功控制真实汽车跑完全程
7

OpenAI Academy 升级,新增开发者与企业管理学习路径

11小时前
OpenAI Academy 升级,新增开发者与企业管理学习路径
8

OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%

11小时前
OpenAI 升级 GPT-6 提示词缓存:Token 成本最高省 90%
热门标签
大模型AgentRAG微调私有化部署Prompt EngineeringChatGPTClaudeDeepSeek智能客服知识管理内容生成代码辅助数据分析金融零售制造医疗教育AI 战略数字化转型ROI 分析OpenAIAnthropicGoogle

关注公众号

前途科技微信公众号

扫码关注,获取最新 AI 资讯

免费获取 AI 落地指南

3 步完成企业诊断,获取专属转型建议

已有 200+ 企业完成诊断