GLM-5.2 程式碼審查實測:提示語品質是關鍵
分享 GLM-5.2 的 Code Review 效果取決於 Prompt 設計,並將其設為日常工具,觀察其實際表現,屬於具體 Prompt 技巧的實戰分享。
Z.ai 的 GLM-5.2 模型在程式碼審查方面的表現差異很大,激發了一項實驗來探究其品質是否受提示語影響。研究團隊建立了一個包含多種錯誤的 TypeScript 後端,並在不同推理努力程度與三種提示語框架下測試 GLM-5.2 的審查能力。在第一輪測試中,針對帶有明顯安全漏洞的簡單程式碼庫,GLM-5.2 無論提示語如何都表現一致且出色,成功捕獲了大多數關鍵錯誤。然而,當面對包含更細微、跨功能產品邏輯錯誤的複雜程式碼庫時,GLM-5.2 的錯誤捕捉率顯著下降,此時提示語的措辭對結果產生了巨大影響。 • 提示語的措辭對 GLM-5.2 的審查方向與效果影響深遠,其重要性甚至超越了推理努力程度。 • 嚴格的「生產環境 PR 審批」提示會促使模型優先關注安全性與程式碼強化,反而可能忽略行為相關的產品邏輯錯誤。 • GLM-5.2 擅長檢測局部錯誤(單一函數內的直接問題),但在理解跨越多個端點的複雜產品規則時則顯得力不從心。
文章指出:「您對 GLM-5.2 的使用體驗,很大程度上取決於您的程式碼強迫它進行多少『點點相連』的工作。」
來源:Kilo Code Blog
閱讀原文 ↗