字节跳动Seed团队最新研究揭示,DeepSeek长上下文表现起伏受输入Token位置影响,甚至每隔数个Token呈周期性波动。根源在于分块KV Cache压缩机制导致的相位敏感性,准确率落差最高超40个百分点。
输入同样的问题,仅仅在前方多插入几个无关字符,大语言模型就可能从答对变为答错。字节跳动Seed团队在最新研究中捕获了这一现象:DeepSeek-V4的表现会随着信息输入位置,呈现出每隔4个Token的周期性波动。
在128K长上下文检索测试中,同一条信息仅因所处相对位置不同,DeepSeek-V4系列模型的检索准确率落差最高可达40.2个百分点。团队研究表明,该现象源自长上下文优化技术——分块KV Cache压缩。

研究团队最初在DeepSeek-V4-Flash-Base上进行代码补全测试。他们截取了官方推理代码中的一段FP8量化函数,要求模型补全最后一个Token(正确答案应为8)。模型有时却会错误预测为32。
为了排查原因,研究人员在代码前插入了一段包含重复等号的纯装饰性字符串,并逐步改变等号数量。在代码逻辑、待补全位置均未改变的情况下,答案展现出强烈的周期性规律:

当填充长度模4余数为0或1时,模型明显偏向错误答案32;余数为2或3时,则高度倾向正确答案8。在一组位置上,错误答案的平均概率高达71.3%;挪动一到两个Token后,正确答案概率则逆转飙升至91.5%。
随后,团队在标准的128K长上下文“大海捞针”测试中复现了此问题。在包含约1.6万个键值对的上下文中,仅调整目标信息相对于压缩窗口边界的位置,DeepSeek-V4-Flash-Base的检索准确率极差达到40.2个百分点,DeepSeek-V4-Pro-Base的差距也达34.8个百分点。

经后训练微调后,DeepSeek-V4.1-Flash的差距降至6.1个百分点,但起伏周期从4个Token缩短为2个Token。这一周期恰好精准对应两代架构所采用的KV Cache压缩步长。
在长文本推理中,KV Cache占据大量显存。分块KV Cache压缩将连续Token划分为固定窗口,并将窗口内的键值信息压缩存储,以大幅减少长上下文注意力计算的开销。
然而,当每4个Token构成一个压缩步长时,信息位于窗口内的第1、2、3或4个位置(即所处“相位”,Phase),其被压缩时的环境截然不同。研究人员将这种性能随位置系统性变动的特征命名为相位敏感性(Phase Sensitivity)。

为排除特定架构或位置编码的影响,研究团队基于Qwen架构自建了一批模型进行消融实验,分别对比全注意力模型与各类分块压缩方案。

实验显示:全注意力基线未出现显著周期性,而所有分块压缩模型均表现出与设定步长严格对应的性能震荡。步长设为6,周期即为6个Token;步长设为8,周期随之变为8个Token。即使移除RoPE位置编码或将可学习压缩改为简单均值池化,现象依然存在。
进一步的注意力头干预实验表明,网络内部演化出了“相位专门化”(Phase Specialization):不同的注意力头逐步对压缩窗口内的特定位置产生分工偏好。这种偏好在分工检索的同时,也使某些特定位置成为推理薄弱点。

研究团队指出,由于常规基准测试往往只汇报平均分,这种隐藏在微观Token站位中的性能洼地极易被掩盖。在评估采用分块KV Cache压缩的模型时,需要将测试样本遍历不同的相位位置,以真实衡量长上下文检索的鲁棒性。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断