提升無狀態 VLM 即時評論自然度:低延遲下的「去 AI 化」與短期記憶挑戰
作者分享了如何使用 Prompt Engineering 技巧,讓無狀態的 VLM 實況評論聽起來更像人類,儘管面臨挑戰,但探討的技術點(Persona rotation, style-specific prompts, deduplication)對社群直播、內容生成等有實際應用價值。
• 內容探討如何讓 無狀態視覺語言模型 (VLM) 的即時評論聽起來更自然,減少濃厚的 AI 生成感。 • 目前的設定是每次生成呼叫都是獨立且無狀態的(單一截圖+提示詞),且必須在 低延遲 限制下,保持提示詞長度最小化。 • 儘管嘗試了人物角色輪換、特定風格提示詞、明確的限制(如「無 AI 語氣」)以及內容過濾,輸出仍過於精緻和刻意,缺乏真實評論的 隨性與自發性。 • 主要挑戰在於輸出仍然帶有 AI 感 且缺乏 多輪對話上下文 時的連貫性,模型難以在不同幀之間保持主題或氛圍的一致性。 • 作者提出疑問,在無狀態 VLM 呼叫中,哪些 提示模式 能建立「短期記憶」,例如壓縮摘要或滾動場景描述? • > 作者想知道:「實際有效的提示技巧是什麼,能讓 VLM 在即時情境下聽起來不那麼像『AI 寫的』?」 • 文章也探討這是否主要是一個 提示設計問題,或是需要重新思考整體方法。
來源:r/PromptEngineering
閱讀原文 ↗