如何透過重新設計 Tokenizer 與解碼器,讓僅 48M 參數的小模型學會精準呼叫工具

獨立開發者分享將工具呼叫壓到 48M 模型並針對特定決策精簡 tokenizer 與 loss 的極客實作心得。

• 作者顛覆傳統做法,不將語法強加於一般模型,而是圍繞 工具呼叫的五個核心決策 來建構 Tokenizer、訓練損失與解碼器。 • 訓練出一個 專門處理工具呼叫 的 48M 超小模型,不處理一般對話或散文,僅讀取函式綱要與請求後輸出結果。 • 透過 語法約束解碼 機制,確保輸出永遠是可解析的 JSON,且參數鍵值與未宣告的工具絕不出錯。 • > 「真正的贏面在於完全消除了最糟糕的失敗模式,並在自由生成容易損壞 JSON 的情境下確保了解析度。」 • 該模型在已知目錄上展現出不俗的準確率,且針對未見過的目錄僅需花費約 56 美元的合成資料 就能進行適應微調。 • 專案開源包含 程式碼庫與模型權重,並公開了十多項失敗實驗的負面結果,對開發類似系統極具參考價值。


來源:r/LLMDevs

閱讀原文 ↗
← 回首頁