跳到主要內容
AI 武林
文章高階中文

下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

來源 美团技术团队

讀原文(在新分頁開啟原站)連到 美团技术团队

摘要

美團 LongCat 團隊提出 LoHoSearch,利用知識圖譜自動構建高難度搜尋智慧體評測題庫,取代人工出題。該基準能更精準區分模型能力,並揭示現有上下文管理策略在長程搜尋中的侷限。

Meituan's LongCat team introduces LoHoSearch, an automated benchmark using knowledge graphs to challenge search agents with high-difficulty questions that expose limitations in current context management strategies.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 以 762 萬維基實體為基礎,自動化構建高難度搜尋題庫。
  • 最強模型 GPT-5.5 準確率僅 34.74%,顯著高於現有基準。
  • 揭示現有上下文管理策略收益收窄,推動下一代技術研究。

提到的工具與公司

適合誰看

搜尋智慧體開發者、機器學習研究人員及 AI 評估相關從業人員。

摘要依據

依據
文章全文

為什麼排在這裡

人氣
0.50
新鮮
0.74

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)