跳到主要內容
AI 武林

他的來源

最受歡迎

依人氣

  1. 8文章Lilian Weng(部落格)高階EN

    Why We Think

    探討了測試時計算(Test-time compute)如何透過延遲思考來提升模型表現。作者指出,將模型視為資源進行最佳化,並結合心理學中的「快思考」與「慢思考」理論,解釋了為何延遲思考能挑戰本能並促進更理性的決策。

最新內容

依發布時間

  1. 文章Lilian Weng(部落格)高階EN

    Scaling Laws, Carefully

    深入探討了深度學習中的「規模定律」(Scaling Laws),指出訓練損失與模型大小、資料量及計算資源呈冪律關係。作者強調,雖然理論預測了這些關係,但在實際應用中,如何精確擬合這些定律並避免過度擬合(overfitting)仍是關鍵挑戰。

  2. 文章Lilian Weng(部落格)高階EN

    Why We Think

    探討了測試時計算(Test-time compute)如何透過延遲思考來提升模型表現。作者指出,將模型視為資源進行最佳化,並結合心理學中的「快思考」與「慢思考」理論,解釋了為何延遲思考能挑戰本能並促進更理性的決策。

  3. 文章Lilian Weng(部落格)高階EN

    Thinking about High-Quality Human Data

    探討了高品質人類資料在現代深度學習模型訓練中的核心地位。作者指出,雖然許多技術能輔助資料質量,但資料收集本身需要精細的執行與細節關注。文章透過「智慧群眾」的歷史案例,介紹了如何透過設計任務、篩選評審者、聚合資料來提升質量。

  4. 文章Lilian Weng(部落格)進階EN

    Adversarial Attacks on LLMs

    探討了大語言模型(LLM)面臨的攻擊性威脅,包括白盒與黑盒下的攻擊方式。作者指出,雖然模型在訓練時已加入安全機制,但攻擊者仍可能透過修改字元、利用梯度或進行提示工程來誘發不想要的輸出。

  5. 文章Lilian Weng(部落格)入門EN

    Prompt Engineering

    介紹了 Prompt Engineering(即 In-Context Prompting),是一種透過在提示中提供範例來引導大語言模型行為的方法,無需更新模型權重即可達成目標。

  6. 文章Lilian Weng(部落格)高階EN

    How to Train Really Large Models on Many GPUs?

    探討如何將大型神經網路模型在多台 GPU 上高效訓練。作者介紹了資料並行、計算並行、分層並行、分塊並行以及分塊並行等並行策略,並深入分析了混合精度訓練、ZeRO 最佳化器以及稀疏化專家混合模型(MoE)等技術如何解決記憶體瓶頸與訓練效率問…

  7. 文章Lilian Weng(部落格)高階EN

    Neural Architecture Search

    探討了神經架構搜尋(NAS)的核心概念,包括搜尋空間設計、搜尋演算法與評估策略。文章指出,雖然現有架構多由專家設計,但透過系統化與自動化的學習方法,才能更有效地探索並找到最佳架構。

  8. 文章Lilian Weng(部落格)高階EN

    Curriculum for Reinforcement Learning

    探討如何透過課程學習(Curriculum Learning)提升強化學習(Reinforcement Learning)的效率。作者指出,設計一個有效的課程需要解決兩個核心問題:如何量化任務的難度,以及如何提供難度遞增的任務序列。