AI 日报hiw3c.com

字节找到了DeepSeek时强时弱的原因

量子位 www.qbitai.com 网页快照

字节找到了DeepSeek时强时弱的原因

闻乐 发自 凹非寺 量子位 | 公众号 QbitAI

Seed研究人员发现,DeepSeek-V4的表现竟然会随着信息的输入位置, 每隔4个Token周期性变化 。

在128K长上下文检索测试中,研究人员发现,同一条信息只是换了个位置,DeepSeek-V4系列模型的检索准确率 最高就能拉开40.2个百分点 。

团队进一步发现,这个问题与DeepSeek-V4采用的一项长上下文优化技术有关——

多两个Token,DeepSeek突然就答对了

他们从DeepSeek-V4的官方推理代码中截取了一段FP8量化函数,让模型补全最后一个Token。

为了搞清到底咋回事,研究人员在代码前面加了一段纯装饰性的文档字符串,里面放着一些重复的等号。

代码本身没改、要补全的位置没改、正确答案当然也没改……唯一的变化,就是前面多了这几个没什么实际意义的Token。

更具体地说,在论文测试的16种填充长度中,当长度模4的余数为0或1时,模型倾向于错误答案32;余数为2或3时,则倾向于正确答案8。

研究人员构造了一段长达128K Token的上下文,里面包含约 1.6万个键值对 。

结果发现,DeepSeek-V4系列的准确率曲线,竟然呈现出非常明显的周期性起伏。

其中DeepSeek-V4-Flash-Base在不同位置之间的最大准确率差距达到40.2个百分点

DeepSeek-V4-Flash-0731的差距缩小到19.1个百分点,DeepSeek-V4-Pro-0813缩小到14.8个百分点。

而更新的DeepSeek-V4.1-Flash-0910,差距进一步降至6.1个百分点。

再往细看,DeepSeek-V4的波动周期是4个Token,DeepSeek-V4.1则变成了2个Token。

问题出在KV Cache压缩?

大模型处理长上下文时,需要保存大量历史Token对应的Key和Value信息,供后续注意力计算使用。

尤其是动辄几十万、上百万Token的长任务,KV Cache很容易成为推理效率的瓶颈。

但Seed团队发现,DeepSeek出现神鬼二象性的原因可能就藏在这个分块过程里。

那么,同一条信息出现在窗口里的第1、第2、第3或第4个位置,压缩时所处的条件就可能不同。

研究人员发现,即使Key和Value都落在同一个压缩窗口里,不同位置的检索准确率也能相差很大。

他们以 Qwen3-0.6B架构 为基础,构造了多种KV Cache压缩方案,并设置没有分块压缩的全注意力模型作为对照。

甚至不使用RoPE位置编码,或者把可学习的压缩权重换成简单平均,这种现象依然存在。

Seed团队进一步对注意力头进行干预,观察移除不同组件之后,模型在各个相位上的检索能力如何变化。

也就是说,模型内部似乎形成了一种分工:不同注意力组件,对压缩窗口里的不同位置产生了偏好。

论文还通过简化的理论模型分析了训练过程,发现梯度流可能推动压缩模块形成稳定的位置偏好。

这也解释了为什么这种周期性并非简单的随机噪声。它可能是模型在学习如何压缩信息时,自然而然形成的结果。

但这类问题未必能从普通Benchmark里直接看出来,因为常规评测通常会把大量测试结果汇总成一个平均分。

假设模型在某些位置表现很好,在另一些位置明显掉队,最后算出来的平均成绩可能依然不错。

所以Seed团队提出,评估采用分块KV Cache压缩的模型时,不能只看整体检索准确率,还得把同一条信息放到不同压缩相位上,分别测一遍。

可即便存在这种位置带来的性能偏差,长上下文推理的内存和计算成本摆在那里,压缩仍然有很现实的价值。

arXiv最严新规!每人每月最多提交2篇,拒稿不退额度 2026-10-02

DeepSeek扩招!弹性计算团队大量HC,尤其需要资深工程师 2026-10-03

首个AIGC长片大赛!RunningHub单项大奖100万,科幻IP免费改编 2026-09-15

吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞 2026-09-11

相关阅读

字节Seed开源长线记忆多模态Agent,像人一样能听会看

百度搜索×DeepSeek!官宣接入仅24小时全量上线满血版,实测来了

深度体验DeepSeek Harness,我原谅它涨价了

2026年,1800个DeepSeek跟我一起守护艾泽拉斯

DeepSeek华为火线联手!硅基流动首发即限流,全国产API白菜价,零门槛部署

DeepSeek秘密造芯!专攻推理,一年前已启动,招聘全程不公开

热门文章

OpenAI安全团队持续地震!负责人离职,三名员工因泄密被开

DeepSeek扩招!弹性计算团队大量HC,尤其需要资深工程师

Jev估值100亿美元!创始人Diogo Almeida回答一切

GPT-6要“吃掉”3D公司?这家公司不到2年ARR翻百倍,破1亿美元

AI算力硬合作,马斯克还是更相信中国制造

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1