當 LLM 評測機制「狼來了」:我是如何學會用統計雜訊過濾模型誤判的
開源作者分享 LLM 迴歸測試閘道因雜訊誤報的慘痛教訓,以及教導閘道測量自身雜訊的開源實作。
• 作者在 CI 管道中運行 LLM 評分機制 時,發現評分在完全相同的程式碼與配置下出現劇烈波動,導致工程師白白浪費時間排查。 • 這種「程式碼沒變卻分數驟降」的現象若頻繁發生,會讓團隊對自動化測試失去信任,最終忽略真正的系統退化。 • 為了克服 LLM 作為裁判 的隨機性,作者改為對每個測試案例進行多次運行,並記錄其分數分佈範圍作為基準。 • 只有當分數下降超出原本的雜訊區間時,系統才會真正判定為回歸錯誤,避免被模型的隨機雜訊誤導。 • 評測基準直接以檔案形式存放在儲存庫中,每次更新都需要經過人工審核與提交,確保透明且不依賴外部伺服器。
一個會亂叫狼來了的檢查機制,在一個月內就會被大家無視,然後真正的系統退化就會悄悄溜進來。
來源:r/LLMDevs
閱讀原文 ↗