讓AI離開溫室走向動態世界:MineExplorer揭示頂級多模態大模型的能力斷層

美團技術團隊發表多模態長程任務評測基准 MineExplorer,剖析大模型在開放世界的能力斷層

• 美團 LongCat 團隊推出 MineExplorer,這是首個在開放世界中實現分鐘級長程任務的評測基准。 • 測試顯示18款頂級多模態大模型在動態環境中集體「考砸」,最強模型在 4跳任務 的成功率僅剩 12 分。 • 研究揭示了關鍵能力斷層:模型普遍 感知強於推理,近 60% 的失敗原因是由於導航失敗與無法對齊世界狀態。 • 實驗証明簡單增加步數或歷史記憶並非解藥,瓶頸在於缺乏將感知轉化為長程行動計劃的 通用探索力。 • MineExplorer 具備 813 個高質量實例,並開源了 多智能體數據合成方法論 與沙盒訓練環境。

「看得見世界,不代表能探索世界。在會變化的世界里持續推理、持續行動——這才是AI走向真實世界,必須先跨過的那道門檻。」


來源:美團技術團隊

閱讀原文 ↗
← 回首頁