Qwen3.6-27B 模型微調抉擇:持續預訓練、SFT 還是強化學習能減少災難性遺忘?
探討模型微調路由(預訓練 vs SFT vs RL)並引用最新論文分析災難性遺忘的深度技術探討,對模型微調實作者很有幫助
• 探討在 Qwen3.6-27B 模型上進行模型調適時,哪種訓練方法能有效避免模型原有能力的退化。 • 傳統的 SFT/LoRA 微調方法容易導致明顯的災難性遺忘,影響範圍涵蓋程式碼編寫、推理與指令遵循等多個領域。 • 近期研究指出,採用 強化微調(Reinforcement Fine-Tuning) 或 線上數據(On-Policy Data) 能在很大程度上保留先前學到的能力。 • 然而,也有研究顯示 RL 同樣可能引發遺忘問題,並非完美的單一解法,必須搭配如損失自適應學習等優化策略。 • > 作者特別關注:「是否有開發者直接在 Qwen3.6-27B 上比較過持續預訓練、SFT 與強化後訓練的實際表現與基準測試差異?」 • 社群實測經驗與具體的訓練參數分享,將有助於釐清「持續預訓練加上少量 SFT/RL」是否比直接進行大規模 SFT 更安全可靠。
來源:r/LocalLLaMA
閱讀原文 ↗