QLoRA 蒸餾 Qwen3-4B 對比 Zero-shot:從分類與結構化萃取看微調成效與極限

提供 QLoRA 微調小模型的完整實戰數據、配方與混淆矩陣分析,高信號實作心得。

• 作者使用合成資料與 Qwen2.5-72B-Instruct 作為教師模型,評估 QLoRA 微調後的 Qwen3-4B 在狹窄重複任務上的表現,並與 zero-shot 基準進行對比。 • 在支援單分類任務中,微調後的模型將標籤準確率從 72.4% 提升至 90.8%;在發票 JSON 欄位萃取中,完全正確的資料列比例更是從 1.2% 暴增至 62.5%。 • 實驗發現,微調模型在發票萃取上最大的突破不在於「學會萃取」,而是學會在資訊不足時 「保持空白、遵守 Schema 規範」 而不胡亂猜測。 • 透過檢視錯誤分類的混淆矩陣,作者發現許多錯誤其實是 教師模型本身存在語意模糊(如投訴分類與帳務重疊),這說明蒸餾模型的表現上限受限於教師模型的自我一致性。

「學生模型無法學會教師模型本身就不具備的規則。」 • 雖然合成資料與真實生產環境有落差,但微調小型模型不僅大幅降低 推論成本,也證實了分類、萃取與固定樣式改寫等任務非常適合進行知識蒸餾。


來源:r/LLMDevs

閱讀原文 ↗
← 回首頁