GeoRA:為大模型強化學習推理量身打造的 LoRA 技術解析

美團技術團隊解析獲 ACL 2026 傑出論文的 GeoRA(專為 RLVR 設計的低秩訓練方法)及其在業務 Agentic RL 中的落地經驗。

• 近期研究指出,RLVR(基於驗證的強化學習) 與 SFT(監督微調) 的優化幾何存在本質差異,直接套用傳統的 LoRA 先验容易導致能力遺忘或訓練崩潰。• 美團與北京大學提出的 GeoRA 方法,透過「定位加壓縮」策略,將低秩適配顯式對齊至 RLVR 的更新幾何上。• 該方法首先結合 譜先驗 與 歐氏先驗 篩選出穩定且可塑的稀疏參數區域,再運用 SVD(奇异值分解) 壓縮成低秩稠密適配器。• 透過建立殘差錨點,GeoRA 在訓練初始化時能保持函數不變,有效平滑冷启动並保護預訓練結構。• 在 1.5B 到 32B 的 Qwen 與 Llama 模型實驗中,GeoRA 在數學、醫學與代碼等任務上皆穩定優於現有的低秩基線。• > 幾何對齊的子空間更新不僅能提升目標域推理能力,還能顯著減少對既有能力的遺忘,兼具速度與顯存優勢。• 目前該技術已成功落地於實際業務場景中的 Agentic RL,以更低的訓練成本達到接近全參微調的優異效果。


來源:美團技術團隊

閱讀原文 ↗
← 回首頁