讀原文(在新分頁開啟原站)連到 美团技术团队
摘要
美團 LongCat 團隊提出 LoHoSearch,利用知識圖譜自動構建高難度搜尋智慧體評測題庫,取代人工出題。該基準能更精準區分模型能力,並揭示現有上下文管理策略在長程搜尋中的侷限。
Meituan's LongCat team introduces LoHoSearch, an automated benchmark using knowledge graphs to challenge search agents with high-difficulty questions that expose limitations in current context management strategies.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 以 762 萬維基實體為基礎,自動化構建高難度搜尋題庫。
- 最強模型 GPT-5.5 準確率僅 34.74%,顯著高於現有基準。
- 揭示現有上下文管理策略收益收窄,推動下一代技術研究。
提到的工具與公司
- LoHoSearch
- GPT-5.5
- DeepSeek-V4-Pro
- Claude-Opus-4.6
- Kimi-K2.6
- DeepSeek-V4-Flash
- BrowseComp
- ReAct
適合誰看
搜尋智慧體開發者、機器學習研究人員及 AI 評估相關從業人員。
摘要依據
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.50
- 新鮮
- 0.74
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 美团正式发布 CatPaw:全场景 AI Agent,从个人提效到企业智能化文章 ・ 美团技术团队
- I talked to Google's former AI head about messy data文章 ・ Gradient Flow(Ben Lorica)
- Agentic Search: 搜尋技術不會消失,只是變成 Agent 工具文章 ・ ihower(張文鈿)
- Episode 68: A Builder’s Guide to Agentic Search & Retrieval with Doug Turnbull & John BerrymanPodcast ・ Vanishing Gradients ・ 1 小時 29 分
- 让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层文章 ・ 美团技术团队
- #733.BM25 在智能体搜索中出人意料的有效性,简单工具为何重新变强Podcast ・ 跨国串门儿计划 ・ 18 分鐘
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)
