我用 EchoNet 測試了 9 款開源模型:誰能一眼識破 AI 搜索中的假新聞?

開發者自建 EchoNet 基準測試開源模型在代理搜尋中識別虛假來源與對抗幻覺的能力,具極高參考價值

• 開發者建立名為 EchoNet 的基準測試,透過合成包含假資訊的網頁環境,評估模型在面對記憶與新資訊衝突時的知識裁決能力。 • 測試涵蓋 GLM 5.2、Qwen3.8 與 DeepSeek V4 等 9 款開源權重模型,每款模型進行 50 到 100 次實驗。 • 結果顯示,單一假網頁或同溫層重複造謠對模型影響有限,但「虛假多數暴力」(用多個自信的假來源包圍真實一手來源)會讓準確率驟降。 • GLM 5.2 與 Qwen3.8 模型展現極佳的抗毒性,完全沒有被單次騙過;相對地,部分模型容易受到假多數影響而更改答案。 • 測試同步比較了 EAS 綜合評分與實際 API 成本,發現 Qwen3.8 Flash 在性價比上表現優異。

「沒有任何來源可以偽裝成正確的答案,但模型往往會被多個獨立且自信的謊言所迷惑。」


來源:r/LocalLLaMA

閱讀原文 ↗
← 回首頁