將推理原則蒸餾入 7B 模型:使其學會反駁、提供路徑,而非盲目順從
分享將「質疑/反對」的 reasoning doctrine 濃縮到 7B 模型,讓其能推拒不合理請求,是 Prompt Engineering 的進階應用,改變了傳統的服從性調校。
此專案顛覆了傳統提示工程中追求模型「順從」的目標,透過將一套被稱為「Hammerstein 框架」的推理原則,精煉並嵌入一個 7B 模型之中。這個輕量級模型被訓練成能主動反駁、質疑並提供策略性指導,而非盲目同意。 • 它展現了三種關鍵行為:「有路徑的拒絕」,在拒絕請求時同時指明可行的解決方案;「堅守立場」,即便面對自信但缺乏證據的質疑,也能堅持其結構性原因;以及**「拒絕愚蠢勤奮」**,不認可效率低下的錯誤努力,並提供明確的驗證機制。
作者指出,這些「校準式異議」行為是明確可指定的訓練目標,與主流大型語言模型(LLM)傾向於「取悅使用者」的強化學習目標形成對比。 此 7B 模型專為框架式策略推理任務量身打造,其核心原則已內建於模型權重中,無需運行時系統提示。它不僅能處理複雜的策略判斷,也能在遇到無關框架的簡單問題時,提供直接明瞭的答案。 • 這個開源模型(Apache-2.0)僅需 8 GB GPU 即可運行,證明了將特定推理能力「蒸餾」進小型模型的可行性與可攜性。
來源:r/PromptEngineering
閱讀原文 ↗