字节揪出DeepSeek-V4隐藏盲区:代码没变,答案却周期性出错

BiRun 讯,字节跳动 Seed 团队发现,DeepSeek-V4 在长文本处理中存在一种规律性弱点。研究人员让模型补全一段代码,代码本身没有变化,只延长了前面一段无关注释,模型的答案就会在正确和错误之间来回切换。V4-Flash 基础版每隔 4 个 Token 重复一轮,V4.1-Flash 也存在类似现象,周期变成 2 个 Token。

问题与 DeepSeek 节省显存的「分块 KV 缓存压缩」有关。模型会把连续几个 Token 的信息合并保存,降低处理长文本的成本。但这种压缩会让不同位置的信息得到不同程度的保留,某些位置的内容更难在之后被准确找回。字节将这种周期性检索差异称为「相位敏感性」。

在约 12.8 万 Token 的检索测试中,V4-Flash 基础版在不同位置上的准确率最高相差 40.2 个百分点。经过后训练,差距缩至 19.1 个百分点;V4.1-Flash 进一步缩至 6.1 个百分点,但周期性波动仍然存在。字节还从零训练了多组对照模型,发现波动周期与压缩步幅一致,未使用分块压缩的对照模型没有出现相同规律。

信源

动察 Beating 频道 · 动察 Beating 交流群。
你怎么看这条消息?来投第一票

评论

0/500
免责声明:本文内容仅供参考,不构成任何投资建议。
更多快讯