LLM 效能評測只跑一次只是雜訊?開發者重測 290 次後的驚人發現

開發者深入反思模型基準測試的隨機性,透過多次重複實驗修正偏差的誠實踩坑分享。

• 作者起初以 29 道問題測試平價與高價模型,發現高價模型僅贏一題便宣稱勝出,隨即遭讀者質疑單次測試的隨機性與準確度。 • 為了驗證結果,作者將整場考試對兩款模型重複執行 5 次(共計 290 個答案),發現在保留 Temperature 隨機性的情況下,原先決定勝負的關鍵題目竟再也不曾重現。 • 經過多次重測後,兩款模型在嚴重錯誤(fatal errors)的表現上打平,證明原本微小的勝差僅僅是機率分佈中的一個樣本。 • 數據顯示,模型在資訊不足的模糊題目上偶爾會出現危險的猜測,但在大多數明確題目上的表現相當穩定。

「單次測試不僅會模糊排名,更可能讓極端值成為贏家;在發布模型差距前,至少應該重複測試 5 次。」 • 作者最後提醒,雖然重複測試證明了現有題目的穩定性,但若要擴大評測範圍,仍需增加不同題目的數量而非盲目增加重測次數。


來源:r/LLMDevs

閱讀原文 ↗
← 回首頁