大型語言模型成本翻三倍:流量不變,重試與上下文才是隱形殺手
用戶分享 LLM 請求成本翻倍的原因是重試和過長的上下文,而非流量增加,揭示了隱藏的成本陷阱,提供了優化實際應用成本的寶貴經驗。
開發團隊發現,大型語言模型(LLM)的每請求成本意外地增長了三倍,但流量並未增加,顯示問題出在成本結構而非使用量。經過詳細追蹤,他們發現了兩個主要原因導致費用飆升。
• 首先,一個 超時重試機制 存在缺陷,導致在特定失敗模式下,一個請求會觸發多達三次的完整計費調用。這個錯誤已被修正。
• 其次,系統提示 在數月間被持續添加內容,累積了近 4,000 個詞元,其中甚至包含相互矛盾的指示。這種 上下文膨脹 顯著增加了每次請求的費用。
作者指出,儘管重試問題是一個程式錯誤,但提示膨脹卻是「人的問題」,因為沒有人願意刪除他人為「防範措施」而添加的內容。
團隊正在尋找一個健全的流程,以防止共享系統提示演變成這種失控狀態,並認為這需要比人工審核更「無聊且自動化」的解決方案。
來源:r/LLMDevs
閱讀原文 ↗