美團開源下一代搜索智能體評基準 LoHoSearch,用知識圖譜校準 AI 能力認知

美團開源新一代搜索智能體評測基准 LoHoSearch,探討知識圖譜校准 AI 能力認知的技術細節

• 美團 LongCat 團隊推出全新開源的 LoHoSearch 評測基准,旨在突破現有人工出題的局限,利用 知識圖譜 自動化生成高難度問題。• 該基準基於涵蓋 7,620 萬個實體的維基百科圖譜構建,透過搜索空間與結構複雜度雙維度控制,打造出具備極高挑戰性的評測環境。• 實驗顯示當前頂尖模型表現受挫,GPT-5.5 的準確率僅有 34.74%,凸顯現有模型在處理長程搜索與複雜推理時的明顯不足。• 數據指出解題平均工具調用次數從 35 次暴增至 61 次,且現有的上下文管理策略在該基準上的提升幅度僅有 6.8%,遠低於傳統基準。> 知識圖譜是系統化構造高難度題目不可或缺的基礎,LoHoSearch 為下一代 搜索智能體 與上下文管理研究提供了更具區分度的理想試驗場。


來源:美團技術團隊

閱讀原文 ↗
← 回首頁