影片進階EN1.2 萬 次觀看
How to Generate Synthetic Pretraining Data? with Joël Niklaus from Hugginface
看影片(在新分頁開啟原站)連到 YouTube・Deep Learning with Yacine
摘要
影片與 Hugging Face 的機器學習工程師 Joël Niklaus 探討生成合成預訓練資料的實作方法。透過分析 90 項受控實驗與海量資料,揭示構建高品質預訓練資料的關鍵原則與流程。
An interview with Joël Niklaus from Hugging Face on generating synthetic pretraining data for LLMs through controlled experiments.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- Hugging Face
- Arcee
適合誰看
正在研究或構建大型語言模型預訓練資料集的開發者與研究人員。
摘要依據
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.51
- 新鮮
- 0.89
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Exploring JEV hallucination Live | Preparing to train JEV from scratch | Dataset Generation影片 ・ Neural Breakdown with AVB
- How to Generate and Use Synthetic Data for Finetuning文章 ・ Eugene Yan(部落格)
- 一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫Podcast ・ 42章经 ・ 47 分鐘
- Learning with not Enough Data Part 3: Data Generation文章 ・ Lilian Weng(部落格)
- Build an LLM from Scratch 5: Pretraining on Unlabeled Data影片 ・ Sebastian Raschka ・ 2 小時 37 分
- 机器人基座模型的瓶颈-数据从何而来?|畅聊物理世界AI数据的生态Podcast ・ AI Odyssey ・ 47 分鐘
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
