Flaky 不再是 bug,是本体:前端测试思维怎么迁移到 Eval

陳廣亮深度解析將前端測試思維遷移至 Agent Eval 的核心方法論,直面 Flaky Test 痛點並給出具體實作案例。

• 在處理具有機率性質的 AI Agent 時,傳統前端開發中需被修復的 flaky test 已不再是 Bug,而是系統的本質,因此開發思維必須從二分法的「判斷題」轉向涵蓋機率的「統計題」。 • 評估模型表現時,絕對不適合採用逐字相等的 exact match,而應改用分層替代方案:包括毫秒級的 規則斷言、拆解具體維度的 rubric 打分,以及獨立執行的 LLM-as-judge。 • 面對平行運算中的浮點誤差與 batch 調度,單次測試結果毫無意義,必須透過設定 通過率、pass@k 與及格閾值等指標來觀察多次執行的機率分佈。 • 評測集不應該憑空想像,而是工程上的 傷疤集,專門用來將每一次線上翻車或審查逮到的錯誤固化成自動化回歸用例。 • 透過將 eval 整合進 CI 流程,改動 Prompt 或模型不再是憑感覺盲目猜測,而是能透過具體數據與退出碼來把關品質的關鍵機制。

「測不出來,你連自己刚才那一晚是在优化还是在抽签都不知道。」


來源:陳廣亮

閱讀原文 ↗
← 回首頁