影片進階EN4,648 次觀看
Lessons from Generating 12 Trillion Synthetic Tokens — Bogdan Gaza, DatologyAI
來源 AI Engineer
看影片(在新分頁開啟原站)連到 YouTube・AI Engineer
摘要
Bogdan Gaza 分享 DatologyAI 如何透過「種子重寫」技術,將合成資料規模從 300 億擴展至約 1200 億 token。透過最佳化 S3 元資料批處理與統一 Ray/Kubernetes 架構,解決了大規模訓練中的儲存與資源瓶頸。
Bogdan Gaza explains how DatologyAI scaled synthetic data generation to 12 trillion tokens using seed rephrasing and optimized infrastructure.
這筆內容還沒有取得字幕或內文,這段摘要只根據標題與說明欄產生,可能不夠準確;實際內容請以原站為準。
提到的工具與公司
- DatologyAI
- BeyondWeb
- Ray
- Kubernetes
- KubeRay
- vLLM
- Slurm
- EKS
適合誰看
從事大規模模型訓練、合成資料工程或雲端基礎設施運作的工程師。
摘要依據
- 講者
- Bogdan Gaza
- 依據
- 標題與說明欄(還沒有取得字幕或內文)
為什麼排在這裡
- 人氣
- 0.83
- 新鮮
- 0.98
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- How to Generate and Use Synthetic Data for Finetuning文章 ・ Eugene Yan(部落格)
- Learning with not Enough Data Part 3: Data Generation文章 ・ Lilian Weng(部落格)
- The Evolution of Reasoning in Small Language Models with Yejin Choi - #761Podcast ・ The TWIML AI Podcast ・ 1 小時 6 分
- AutoSynthData: Generating Training Data for Enterprise Agents文章 ・ Hugging Face Blog
- KONST 完成 3,000 萬美元 B 輪股權融資,擴大亞洲 AI 資料中心建置規模並推進 Token Factory 布局文章 ・ INSIDE
- Why Models Are AI’s Next Training Dataset with Damian Borth - #772Podcast ・ The TWIML AI Podcast ・ 47 分鐘
摘要由 AI 根據標題與說明欄產生(還沒有取得原文),可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
