我用 4B 模型測試一個月「代碼驗證、模型生成」框架:擊敗同權重與推理模型,但最終翻車
獨立作者深度測試「代碼驗證、模型生成」Harness 模式的完整踩坑與對比心得,達到最高等級實作分享標準。
• 作者花費一個月測試 「代碼驗證、模型生成」 (Code Verifies, Model Generates) 的提示詞框架,將複雜任務拆解為多個階段,並在每個模型呼叫之間插入 嚴格的代碼驗證與算術檢查。 • 測試結果顯示,透過 精簡問題規模 與分段驗證,4B 模型的表現顯著超越單次生成的相同權重模型,甚至在部分指標上勝過專門的 推理模型。 • > 作者坦言:「我嚴格標準的頭條成果並未在第三方測試集存活,失敗的模式往往比成功更有價值。」 • 最大的技術瓶頸在於 跨階段矛盾 (Cross-stage contradiction),即模型在早期階段識別出約束條件,卻在後期階段違背它。 • 實驗證明,傳統的 Regex 與 NLI 方法無法有效解決跨階段一致性檢查,且盲目增加防護機制只是將問題轉移到更深層次。 • 該專案已將 23 個執行記錄、外部對抗性審計與帶有 MD5 封印的保留測試集完整開源至 GitHub。 • 作者公開向社群提問,探討如何在不依賴額外 LLM 評判器的情況下,找到低成本的 階段協議檢查 方法。
來源:r/LLMDevs
閱讀原文 ↗