看影片(在新分頁開啟原站)連到 Bilibili・AITIME论道
摘要
楊智勇老師分享知識蒸餾中學生模型學習教師分佈的機制,提出困難集中與置信集中兩種效應。透過引入α-β散度正則化,實現兩種效應的有效平衡,提升模型壓縮效率。
This talk discusses probability reallocation mechanisms in knowledge distillation, proposing two key effects and using α-β divergence regularization to balance them.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
適合誰看
從事機器學習研究、大模型壓縮或模型最佳化工作的技術人員。
摘要依據
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.22
- 新鮮
- 0.64
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- 【AI系列 Ep09】AI煉金術公開!從巨型模型提煉出智慧的「知識蒸餾」技術!影片 ・ Ku's Lab 古倫維老師研究室 ・
- How Small Models Learn to Think Like Giants | On-Policy Distillation影片 ・ Jia-Bin Huang ・
- Owning the AI Pareto Frontier — Jeff DeanPodcast ・ Latent Space ・ 1 小時 24 分 ・
- Training Agents 2: Live tutorial on model distillation for training custom agents.影片 ・ Hugging Face ・ 1 小時 8 分 ・
- Talk | 吴建宇:DAPD - 如何消除策略自蒸馏中的信息不对称?影片 ・ TechBeat人工智能社区 ・ 23 分鐘 ・
- Making Knowledge Distillation Cheap Enough to Run at Scale文章 ・ Hugging Face Blog ・
這個來源最近的內容
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
