下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知
美團 LongCat 團隊提出 LoHoSearch,利用知識圖譜自動構建高難度搜尋智慧體評測題庫,取代人工出題。該基準能更精準區分模型能力,並揭示現有上下文管理策略在長程搜尋中的侷限。
部落格 ・ 華語圈 ・ 簡體中文 ・ A 級 ・ 10 筆內容 ・ 最近更新 2026/09/22
簡中;大廠工程部落格,約每週一篇:Agent 評測白皮書、推薦基座大模型落地、搜尋排序用 LLM 表徵、頂會論文解析
依人氣
美團 LongCat 團隊提出 LoHoSearch,利用知識圖譜自動構建高難度搜尋智慧體評測題庫,取代人工出題。該基準能更精準區分模型能力,並揭示現有上下文管理策略在長程搜尋中的侷限。
介紹美團推出的全場景 AI Agent 平台 CatPaw,整合其自研的 LongCat 2.0 大模型與本地生活行業知識。
深入探討 Agent 評測的方法論,從建立評測體系、對齊主觀標準到長程 Agent 的軌跡追蹤。讀者能學習如何透過「獨裁者」機制統一評測標準,並利用 Rubric 二元化提升人機一致性,同時掌握從 Bad Case 反饋最佳化評測資產的實…
分享美團技術團隊在 KDD 2026 發表的 8 篇論文,涵蓋推薦大模型、獎勵建模、智慧體搜尋及廣告拍賣等領域,並介紹 KDD Cup 2026 Data Agents 賽道冠軍思路。
介紹美團智播如何利用大模型與多模態技術,解決數字人直播形象僵硬、動作不自然及無法並發的問題。讀者可了解其自研的結構解耦、文字驅動動作生成及流式語音協調等關鍵技術突破,以及這些技術如何實現萬路並發的商業化落地。
介紹美團 LongCat 團隊構建的 MineExplorer,這是首個在開放世界中進行分鐘級長程任務的評測基準。該基準透過動態演化的 Minecraft 沙盒,測試多模態大模型在處理隱藏前置條件與長程規劃時的真實能力,並揭露了當前模型在…
系統介紹 Agent 評測的完整架構,包含四個模組、三種能力與兩條迴圈,並說明如何建立端到端與過程評測集。讀者可掌握評測體系設計邏輯,避免 Agent 專案因缺乏可靠判斷機制而失敗。
介紹美團搜尋團隊如何利用大型語言模型為服務零售場景的查詢與商家生成高精度語義向量,並將其注入排序模型以提升匹配品質。文章詳述了三期技術演進,從驗證可行性到跨場景遷移,解決了傳統特徵工程在處理非標準化服務時的不足,最終實現了線上收益與轉化效…
介紹專為 RLVR 設計的 GeoRA 方法,解決現有低秩訓練在強化學習推理任務中的幾何錯位問題。透過譜與歐氏先驗定位更新區域並進行低秩壓縮,GeoRA 在數學、醫學與程式碼任務上表現優於 LoRA 等基線,同時保持高效。
介紹美團基於 MTGR 推出的統一推薦基座大模型 MTFM,透過異構 Tokenizer 與混合注意力架構解決多場景建模挑戰。讀者可了解其如何實現跨業務特徵免對齊、降低推理成本並提升訂單量,並掌握相關技術細節與實踐成果。
依發布時間
介紹美團基於 MTGR 推出的統一推薦基座大模型 MTFM,透過異構 Tokenizer 與混合注意力架構解決多場景建模挑戰。讀者可了解其如何實現跨業務特徵免對齊、降低推理成本並提升訂單量,並掌握相關技術細節與實踐成果。
系統介紹 Agent 評測的完整架構,包含四個模組、三種能力與兩條迴圈,並說明如何建立端到端與過程評測集。讀者可掌握評測體系設計邏輯,避免 Agent 專案因缺乏可靠判斷機制而失敗。
介紹美團智播如何利用大模型與多模態技術,解決數字人直播形象僵硬、動作不自然及無法並發的問題。讀者可了解其自研的結構解耦、文字驅動動作生成及流式語音協調等關鍵技術突破,以及這些技術如何實現萬路並發的商業化落地。
介紹專為 RLVR 設計的 GeoRA 方法,解決現有低秩訓練在強化學習推理任務中的幾何錯位問題。透過譜與歐氏先驗定位更新區域並進行低秩壓縮,GeoRA 在數學、醫學與程式碼任務上表現優於 LoRA 等基線,同時保持高效。
介紹美團搜尋團隊如何利用大型語言模型為服務零售場景的查詢與商家生成高精度語義向量,並將其注入排序模型以提升匹配品質。文章詳述了三期技術演進,從驗證可行性到跨場景遷移,解決了傳統特徵工程在處理非標準化服務時的不足,最終實現了線上收益與轉化效…
分享美團技術團隊在 KDD 2026 發表的 8 篇論文,涵蓋推薦大模型、獎勵建模、智慧體搜尋及廣告拍賣等領域,並介紹 KDD Cup 2026 Data Agents 賽道冠軍思路。
深入探討 Agent 評測的方法論,從建立評測體系、對齊主觀標準到長程 Agent 的軌跡追蹤。讀者能學習如何透過「獨裁者」機制統一評測標準,並利用 Rubric 二元化提升人機一致性,同時掌握從 Bad Case 反饋最佳化評測資產的實…
介紹美團推出的全場景 AI Agent 平台 CatPaw,整合其自研的 LongCat 2.0 大模型與本地生活行業知識。
美團 LongCat 團隊提出 LoHoSearch,利用知識圖譜自動構建高難度搜尋智慧體評測題庫,取代人工出題。該基準能更精準區分模型能力,並揭示現有上下文管理策略在長程搜尋中的侷限。
介紹美團 LongCat 團隊構建的 MineExplorer,這是首個在開放世界中進行分鐘級長程任務的評測基準。該基準透過動態演化的 Minecraft 沙盒,測試多模態大模型在處理隱藏前置條件與長程規劃時的真實能力,並揭露了當前模型在…