基準高分,長時任務卻「脫軌」:大型語言模型持久性挑戰
描述了 LLM agent 在長時間任務中遺忘規則的問題,並指出benchmark分數無法反映此問題,是真實的「踩坑」分享,對開發長期 agent 的工程師有極大參考價值。
• 許多大型語言模型(LLMs)在 基準測試 中表現優異,卻在執行 長時間任務 時面臨挑戰。 • 發文者觀察到,給予代理程式長達數小時的任務時,初期表現正常,但約 40 分鐘後便會 遺忘預設規則,甚至 推翻先前的決策。 • 作者指出,目前的 基準測試 無法有效衡量模型在 持久性 和 長時任務一致性 方面的能力,因為它們主要專注於簡短、獨立的任務。 • > 「模型在短暫、孤立的任務上可能看起來很棒,但一旦任務有了實際長度,它就會完全迷失方向。」 • 在刻意測試如「大型遷移」這類耗時任務時,大多數模型都會 失去連貫性。 • 然而,GLM-5.2 令人驚訝地完成了整個任務,沒有與自己早期的決策「打架」,表現出其在 長時間內不遺忘 的能力。 • 儘管 GLM-5.2 在獨立的困難任務上不如頂尖封閉模型,但其在 持續性 方面的表現正是作者認為最能避免日常時間浪費的關鍵。 • 發文者好奇其他開發者如何測試模型,以確保其能 獨立穩定運行 半天而不「脫軌」。
來源:r/LLMDevs
閱讀原文 ↗