文章入門EN
Learning with not Enough Data Part 1: Semi-Supervised Learning
讀原文(在新分頁開啟原站)連到 Lilian Weng(部落格)
摘要
探討在標籤資料不足時,半監督式學習的四種主要方法:預訓練加精調、主動學習、自訓練與生成式資料自動生成。文章指出現有研究多聚焦於視覺任務,而語言任務則傾向於預訓練加精調。核心在於設計結合監督與無監督損失的混合損失函式,並透過一致性正則化、教師模型(Mean Teacher)等技術提升模型泛化能力。
This article discusses four main approaches for semi-supervised learning when labeled data is limited: pre-training with fine-tuning, active learning, self-training, and dataset auto-generation. It highlights that while vision research is dominant, language tasks often rely on pre-training with fine…
重點
- 使用大規模無監督資料預訓練,再精調少量標籤資料。
- 透過一致性訓練與教師模型,讓模型對無監督資料也能產生可靠預測。
- 主動學習選取最有價值的無監督樣本進行標籤,節省標籤成本。
適合誰看
資料科學家、AI 工程師、研究人員。
摘要依據
- 講者
- Lilian Weng
- 依據
- 文章全文
為什麼排在這裡
- 人氣
- 0.75
- 新鮮
- 0.00
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Learning with not Enough Data Part 3: Data Generation文章 ・ Lilian Weng(部落格)
- Self-Supervised Representation Learning文章 ・ Lilian Weng(部落格)
- How to Generate and Use Synthetic Data for Finetuning文章 ・ Eugene Yan(部落格)
- Few-Shot Learning (3/3):Pretraining + Fine Tuning影片 ・ Shusen Wang ・ 19 分鐘(在新分頁開啟原站)
- Build an LLM from Scratch 5: Pretraining on Unlabeled Data影片 ・ Sebastian Raschka ・ 2 小時 37 分(在新分頁開啟原站)
- 【生成式AI導論 2024】第3講:訓練不了人工智慧?你可以訓練你自己 (上) — 神奇咒語與提供更多資訊影片 ・ Hung-yi Lee ・ 35 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。讀原文(在新分頁開啟原站)