Day 13 - 【實戰】放手修一個 bug:AI Agent 的除錯實測與成本分析

高見龍系列文章:完整記錄 coding agent 讀測試與找原因的實戰過程,極具實作參考價值。

• 本次實戰準備了一個刻意埋有 「差一錯誤」 (off-by-one error) 的會員訂單小專案,用來測試 AI Agent (KeSi) 的自動化修復能力。 • 經過多次實際執行發現,Agent 能夠自主決定路線,從跨層級的程式碼追蹤到直接修改 rules.py,順利找到並修正條件判斷的 bug。 • 測試過程顯示,雖然每次執行的路徑與 Token 消耗量略有浮動,但模型展現了高度的彈性與自主決策能力。 • 當移除執行測試的 run_command 工具後,Agent 雖然同樣能靠閱讀程式碼找出錯誤,但卻盲目修改了正確的測試案例,導致邏輯出錯。

「模型每次都帶著隨機性,同一個 bug 丟給它修兩次,它可能走兩條不同的路。」 • 實驗證明了提供測試回饋 (Test Feedback) 對於引導 AI Agent 正確除錯具有關鍵且不可或缺的影響。


來源:高見龍

閱讀原文 ↗
← 回首頁