觀點網訊:4月10日,字節跳動豆包大模型團隊宣佈正式開源首個多語言類SWE數據集——Multi-SWE-bench。這一數據集旨在評估和提升大模型的“自動修Bug”能力,標誌着在提升編程錯誤修復方面邁出重要一步。

Multi-SWE-bench基於SWE-bench,首次覆蓋了除Python外的7種主流編程語言,包括Java、Go、Rust、C、C++、TypeScript和JavaScript。這為全棧工程師提供了一個全面的評測基準,有助於更準確地測評和提高大模型的高階編程智能水平。