酷哇科技9月2日發布自适應想象世界模型框架RISE並開源論文、代碼與數據集。該架構單次推理平均推演叠代2.40次,平均推演延遲壓縮至287毫秒左右,NAVSIM v1、v2測試分别取得91.5 PDMS和90.8 EPDMS。
觀點網訊:9月2日,酷哇科技(COOWA)正式發布自适應想象世界模型框架RISE(Refining Imagination through SElective Rollout),並同步開源相關論文、代碼與數據集。該框架面向具身智能領域長期存在的算力消耗與推演性能平衡難題,屬于世界動作模型(World Action Models)方向的系統級調度創新。
傳統世界動作模型允許智能體在執行動作前,于潛在空間中“想象”未來環境演變,通過評估動作後果輔助決策。但現有模型普遍存在資源分配的結構性瓶頸:對所有場景分配固定幀數的想象預算,即“全局固定推演”。
這種“一刀切”機制意味着,無論空曠無人的城市主幹道,還是行人交織的復雜十字路口,系統都在進行同等深度的推演。對簡單場景,過度推演無法提升規劃質量,反而大幅增加推理延遲;對復雜交互場景,固定推演深度又往往不足以解析多方的交互博弈。
針對上述痛點,RISE引入門控機制,通過實時權衡規劃增益與算力消耗,實現算力的動态分配,突破了傳統模型固定算力推演的局限。在動态調度機制下,RISE單次推理平均僅發生2.40次推演叠代,平均推演延遲壓縮至287毫秒左右。
基準測試方面,NAVSIM v1與v2測試中,RISE分别取得91.5 PDMS和90.8 EPDMS的成績,分别超越最強基線0.8和0.9個百分點。需要說明的是,PDMS與EPDMS分别對應v1與v2兩個版本測試集的評估口徑,二者不宜直接混用比較。
nuScenes開環測試中,RISE平均軌迹L2誤差降至0.31m,平均碰撞率壓低至0.10。
架構兼容性方面,研發團隊将RISE調度器以“插件化”方式接入前代DAWN架構。接入後,DAWN模型的PDMS得分從89.1提升至90.3,EP與TTC分别提升2.7分與2.3分。
場景差異化适配是RISE的核心技術邏輯之一。在無需推演的極簡場景,有1248個測試場景在零推演下表現最佳,強行增加推演反而導致性能(EPDMS)從89.9降至88.4。
在涉及密集行人流和穿插車輛的復雜路口,有4036+2180個場景極度依賴3幀以上的深層未來預測。對深度需求最高的場景組,推演深度從0加到4時,EPDMS從88.5提升至91.1。
開源方面,此次随RISE開源的内容限于論文、代碼與數據集。其中CounterDrive數據集包含來自nuScenes的2432條訓練片段、511條測試片段,以及來自NAVSIM的5013條訓練與1000條測試片段。
從行業角度看,RISE以動态調度替代固定推演,為具身智能模型在算力成本與推演性能之間提供了新的平衡路徑,其調度器已驗證可“插件化”接入既有架構。不過,上述成績均來自特定基準測試集,不宜直接等同于全場景最優或整個具身智能領域的全面突破。
免責聲明:本文内容與數據由觀點根據公開信息整理,不構成投資建議,使用前請核實。
審校:李培英
