觀點網訊:10月9日,據報道,字節Seed團隊今年9月底在預印本平臺arXiv提交了一篇論文,談到分塊KV緩存壓縮帶來的相位敏感性,直指DeepSeek“抽風”原因。
該研究評估了基礎版和後訓練版的DeepSeek-V4-Flash和DeepSeek-V4-Pro,以及後訓練後的DeepSeek-V4.1-Flash。
模型通過分塊KV緩存壓縮以固定步幅將連續標記的窗口壓縮為更少的緩存條目,能夠減少長上下文推理的內存和注意力成本。
然而,這種壓縮還引入了一個新的位置座標:Token的相位,或其相對於壓縮窗口邊界的位置。
該團隊發現使用這種壓縮的模型中存在系統性不對稱性:相同的信息在一個階段很容易檢索,但在另一個階段很難檢索,團隊將這種檢索性能的週期性變化稱為相位敏感性。
在採用此類壓縮的大型開放權重模型中,長上下文檢索準確度在各個階段之間可能相差高達40個百分點,平均基準分數可能掩蓋週期性弱點。
