一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫
逯雨鑫以非 AI Lab 背景,僅用 2 周與數百美元成本,透過自學基礎、合成資料與 SFT 技術,成功在 Hugging Face 頂部模型榜上取得突破。
Datasets & Synthetic Data ・ 21 筆內容
資料蒐集、標註、清理,以及用模型產生訓練資料。
也叫做:資料集、数据集、dataset、datasets、合成資料、synthetic data、資料標註、data labeling
由淺入深:入門 → 進階 → 高階
How to Generate and Use Synthetic Data for Finetuning
Eugene Yan(部落格)● 有原文
一个人、两周、数百美元,如何训出登顶 Hugging Face 的模型 | 对谈研究员逯雨鑫
42章经47 分鐘● 有原文
Stanford CS229 Machine Learning | Spring 2026 | Lecture 6: Dataset Split, ML Advice(在新分頁開啟原站)
Stanford Online1 小時 18 分○ 無原文
Datasette Enrichments(在新分頁開啟原站)
Simon Willison7 分鐘○ 無原文
E253|谁在给大模型出题、卖题、判卷?聊聊AI数据行业的野蛮生长
硅谷101播客58 分鐘● 有原文
How Deep Learning Finally Cracked Messy Tables - Frank Hutter(在新分頁開啟原站)
Machine Learning Street Talk1 小時 53 分○ 無原文
Why Models Are AI’s Next Training Dataset with Damian Borth - #772(在新分頁開啟原站)
The TWIML AI Podcast47 分鐘○ 無原文
Learning with not Enough Data Part 3: Data Generation
Lilian Weng(部落格)● 有原文
依相關、人氣、新鮮度綜合排序;站長推薦的加成
逯雨鑫以非 AI Lab 背景,僅用 2 周與數百美元成本,透過自學基礎、合成資料與 SFT 技術,成功在 Hugging Face 頂部模型榜上取得突破。
Stanford CS229 春季 2026 課程第六節,探討如何將資料集進行分割,並分享關於機器學習的實用建議。
※ 摘要僅根據標題與說明
探討 AI 資料行業的透明化困境與新趨勢。節目介紹了 AfterQuery、Bespoke Labs 等快速成長的資料公司,並分析了從傳統人工標註轉向合成資料與強化學習環境的轉變。
Frank Hutter 探討 TabPFN 這套基於合成資料訓練的基礎模型,能在單次前向推演中完成預測。該模型透過先驗結構因果模型生成資料,無需針對每個資料集重新訓練或搜尋超引數,大幅解決了傳統深度學習處理表格資料時的困難。
※ 摘要僅根據標題與說明
Damian Borth 指出,我們常忽視已訓練好的模型本身作為新的訓練資料來源。他介紹了「權重空間學習」方法,將模型視為資料進行最佳化,這能大幅降低開發專模的成本並促進知識跨領域轉移。
※ 摘要僅根據標題與說明
Yejin Choi 探討小語言模型如何透過合成資料、模仿學習與強化學習提升推理能力,並指出資料多樣性對消除智慧差距的關鍵作用。
※ 摘要僅根據標題與說明
依發布時間
探討 AI 資料行業的透明化困境與新趨勢。節目介紹了 AfterQuery、Bespoke Labs 等快速成長的資料公司,並分析了從傳統人工標註轉向合成資料與強化學習環境的轉變。
Frank Hutter 探討 TabPFN 這套基於合成資料訓練的基礎模型,能在單次前向推演中完成預測。該模型透過先驗結構因果模型生成資料,無需針對每個資料集重新訓練或搜尋超引數,大幅解決了傳統深度學習處理表格資料時的困難。
※ 摘要僅根據標題與說明
Nicolas Cole 分享他如何透過 Typeshare 平台,將內容分為商品、性格與原創三個層次,並解釋 AI 如何依循使用者的語言模式重複內容。
※ 摘要僅根據標題與說明
逯雨鑫以非 AI Lab 背景,僅用 2 周與數百美元成本,透過自學基礎、合成資料與 SFT 技術,成功在 Hugging Face 頂部模型榜上取得突破。
介紹如何使用 Strands Agents 與 LeRobot 結合 Hugging Face Storage Buckets,實現從記錄演示到訓練再到部署的完整資料迴圈。
孟繁青探討合成資料與 RSI 如何重塑模型競爭。他指出,雖然國模常依賴蒸餾加速,但真正的競爭力來自於 Pre-training 階段因資源限制倒逼出的創新架構。
※ 摘要僅根據標題與說明
Stanford CS229 春季 2026 課程第六節,探討如何將資料集進行分割,並分享關於機器學習的實用建議。
※ 摘要僅根據標題與說明
Damian Borth 指出,我們常忽視已訓練好的模型本身作為新的訓練資料來源。他介紹了「權重空間學習」方法,將模型視為資料進行最佳化,這能大幅降低開發專模的成本並促進知識跨領域轉移。
※ 摘要僅根據標題與說明
Yejin Choi 探討小語言模型如何透過合成資料、模仿學習與強化學習提升推理能力,並指出資料多樣性對消除智慧差距的關鍵作用。
※ 摘要僅根據標題與說明
光輪智慧 CEO 謝晨探討具身智慧資料荒難,強調合成資料與模擬模擬的重要性。他回顧從 Cruise 到英偉達的演進,並分析 Meta 收購 Scale AI 的商業決策。
※ 摘要僅根據標題與說明
用 GPT-4 Turbo 和 Datasette 將非結構化文字與圖片轉換為資料庫表單格。
※ 摘要僅根據標題與說明
Simon Willison 在影片中指出,Datasette 是一個用於儲存 AI 訓練資料的資料庫,並強調其設計初衷是讓使用者能輕鬆地存取和分享這些資料。
※ 摘要僅根據標題與說明