LLM Harness 開發者必備:揪出快取失效的簡單工具
r/LocalLLaMA 分享一個用於捕捉 LLM 調用中快取失效問題的工具,對開發 Harness 的人很有幫助。
• 許多 LLM 應用(harness)開發者在處理 本地大型語言模型 時,常面臨 預填充成本 過高的問題。
• 這些成本主要源於 快取失效,例如訊息順序錯亂、訊息內容、系統提示、工具或甚至 reasoning_effort 的微小變動。
• 為解決此問題,作者開發了 cache-hunter 工具,作為 harness 與實際 LLM 端點之間的代理。
• 啟用後,cache-hunter 能即時監控會話,以紅色單元格標示出不穩定的部分,如 reasoning_effort、工具雜湊或系統提示的意外變動。
• 作者測試發現,許多現有 harness 存在系統提示、工具或訊息順序不穩定的情況。
• > 作者認為,這種快取失效的檢測不應只仰賴開發者的經驗,而是應該成為標準測試流程的一部分。
• 使用 cache-hunter 有助於開發者理解並解決 隱藏成本 問題,從而提升應用程式的穩定性與效率。
來源:r/LocalLLaMA
閱讀原文 ↗