跳到主要內容
AI 武林
文章入門EN

Learning with not Enough Data Part 1: Semi-Supervised Learning

來源 Lilian Weng(部落格)人物 Lilian Weng

讀原文(在新分頁開啟原站)連到 Lilian Weng(部落格)

摘要

探討在標籤資料不足時,半監督式學習的四種主要方法:預訓練加精調、主動學習、自訓練與生成式資料自動生成。文章指出現有研究多聚焦於視覺任務,而語言任務則傾向於預訓練加精調。核心在於設計結合監督與無監督損失的混合損失函式,並透過一致性正則化、教師模型(Mean Teacher)等技術提升模型泛化能力。

This article discusses four main approaches for semi-supervised learning when labeled data is limited: pre-training with fine-tuning, active learning, self-training, and dataset auto-generation. It highlights that while vision research is dominant, language tasks often rely on pre-training with fine…

重點

  • 使用大規模無監督資料預訓練,再精調少量標籤資料。
  • 透過一致性訓練與教師模型,讓模型對無監督資料也能產生可靠預測。
  • 主動學習選取最有價值的無監督樣本進行標籤,節省標籤成本。

適合誰看

資料科學家、AI 工程師、研究人員。

摘要依據

講者
Lilian Weng
依據
文章全文

為什麼排在這裡

人氣
0.75
新鮮
0.00

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)