觀點網訊:4月30日,智譜發佈技術博客《Scaling Pain:超大規模Coding Agent推理實踐》,首次系統披露GLM-5系列模型在超大規模Coding Agent調用場景下的底層推理技術突破。

據介紹,針對Context Parallel策略中的KV Cache冗餘存儲問題,智譜設計實現了KV Cache分層存儲方案LayerSplit,每張GPU僅持有部分層的KV Cache,通過廣播機制完成協同計算。在Cache命中率90%條件下,40K至120K請求長度區間內,系統吞吐量提升10%至132%,且上下文越長收益越顯著。

信息顯示,智譜團隊不僅在自有推理鏈路中定位並修復了PD分離架構下的KV Cache跨節點複用競態,更在開源推理框架SGLang源代碼層面修復了HiCache模塊的加載時序缺失問題,修復方案已被SGLang開源社區採納。