觀點網訊:字節跳動Seed團隊今年9月底在預印本平臺arXiv提交一篇論文,指出DeepSeek長上下文性能漂移(“抽風”)的原因,與分塊KV緩存壓縮帶來的相位敏感性有關。

該研究評估了基礎版和後訓練版的DeepSeek-V4-Flash和DeepSeek-V4-Pro,以及後訓練後的DeepSeek-V4.1-Flash。

模型通過分塊KV緩存壓縮,以固定步幅將連續標記的窗口壓縮為更少的緩存條目,能夠減少長上下文推理的內存和注意力成本。

這種壓縮同時引入了一個新的位置座標:Token的相位,或其相對於壓縮窗口邊界的位置。