星塵智能9月4日發布在線強化學習框架SmoothRL,解決大模型異步推理下在線RL的動作復盤問題。動态投擲任務成功率從39%提升至94%,給筆戴帽從8%升至83%,開箱從30%升至90%,末端執行器加速度RMS降低52%。
觀點網訊:9月4日,星塵智能基座模型團隊發布在線強化學習框架SmoothRL,由王佳楠擔任項目負責人。該框架可異步執行,解決的是大模型異步推理成為真實部署常态後,與之适配的在線強化學習該從哪些動作里學的問題。
在異步推理場景下,模型完整生成一段動作序列,但機器人真正執行過的往往只有其中一截。SmoothRL的思路是學習只對準真正執行過的動作,沒做過的動作不因任務成功被記功,也不因失敗背鍋。
SmoothRL首次将這類異步在線強化學習放到真實高動态投擲任務中驗證。在累計250個rollout episodes的評估節點,動态投擲任務成功率從39%提升至94%。
另兩項測試任務中,給筆戴帽任務成功率從8%提升至83%,開箱任務成功率從30%提升至90%。上述數據均為星塵智能官方披露的測試結果。
末端執行器性能方面,在線RL後右側末端執行器的加速度RMS降低52%,jerk(加加速度)降低47%。
星塵智能方面表示,此次驗證證明在線學習不僅能用于高精度修正,也能适配連續加速、精确釋放、不能停頓的動态操作,為機器人在真實部署中的持續學習提供了技術路徑。
免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。
審校:歐詩雅
