大型語言模型為核心:免環境合成資料生成,突破API呼叫代理訓練瓶頸
提出一種新的 API-Calling LLM 訓練方法,解決數據收集瓶頸,對研究者和有需求的開發者有實質技術價值。
訓練呼叫API的大型語言模型代理(API-calling LLM agents)極需海量高品質的互動軌跡(trajectories),但傳統數據收集方式因依賴實作環境(implemented environments)與可執行API(executable APIs)而構成嚴峻的擴展性瓶頸(scalability bottleneck)。為克服此挑戰,本研究提出一種環境無關(environment-free)的合成資料生成(synthetic data generation)方法,利用大型語言模型作為即時的數位世界模型(digital world models)。
• 該方法僅需API規範(API specifications),便能生成模擬代理與有狀態環境互動的軌跡。 • 具體來說,一個LLM會先生成多樣化的任務,接著一個教師代理(teacher agent)迭代解決任務,同時一個LLM模擬器(LLM simulator)根據任務上下文和模擬歷史產生連貫的合成API響應。 • 最後,一個LLM評判器(LLM judge)會過濾這些軌跡,以確保生成數據集的品質。
在AppWorld和OfficeBench等基準測試上的評估顯示,利用其合成數據微調模型能帶來顯著的效能提升(significant performance gains),證明即使沒有任何可執行環境(executable environment),也能為API呼叫代理生成有效的監督數據。
作者強調:「基於大型語言模型的API模擬,為訓練跨多樣API生態系統代理提供了一個實用且可擴展的解決方案。」
來源:Apple ML Research
閱讀原文 ↗