觀點網訊:1月6日,智元具身研究中心發佈SOP(Scalable Online Post-training)框架,首次將在線學習、分佈式架構與多任務通才性引入物理世界VLA後訓練,實現機器人集羣在真實環境中分鐘級模型同步更新。

根據公開資料整理,SOP採用Actor-Learner異步架構,多機器人並行採集數據並上傳雲端,動態調整在線/離線數據比例,3小時內使商超場景綜合性能提升33%,靈巧操作任務成功率普遍升至94%以上,其中紙盒裝配達98%。實驗顯示,四機集羣訓練速度為單機2.4倍,有效避免過擬合,36小時連續作業驗證系統魯棒性。