提升大模型摘要與檢索能力:六個月筆記實測與調校經驗分享
基於半年筆記寫作 harness 評測經驗,深入分享模型摘要與檢索能力的實戰數據與教訓。
• 作者透過建構實作環境與 50 多篇論文 的研究,實際評估大模型在筆記寫作與檢索上的表現。 • 實測顯示,保留逐字稿(Verbatim)的表現明顯優於讓模型進行摘要,摘要組在各類問題中的表現皆墊底。 • 透過 BM25 加權 共現圖譜,成功將召回率(recall@10)從 0.51 大幅提升至 0.86。 • 實驗發現額外增加的「筆記間衍生邊」非但沒有幫助,反而帶來負面效果,移除後更提升了效能並降低成本。 • 利用 FActScore 進行事實查核時,關鍵在於將實體筆記與整個對話進行比對,修正評估範圍後準確率顯著回升。 • 系統最終透過 圖譜結構(Vault as a graph)來處理多份 PDF 文件,實現可中斷且具備溯源能力的知識管理架構。
「不要讓模型改寫來源。」作者指出維持相同的管線與逐字記錄,比盲目讓模型生成摘要更能確保檢索品質。
來源:r/LLMDevs
閱讀原文 ↗