<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
<channel>
  <title>AI 武林：GPT-2</title>
  <link>https://aiwulin.itsmygo.uk/tools/gpt-2/</link>
  <description>AI 武林收錄的內容裡，最新提到 GPT-2 的 17 筆，每筆附中文摘要。</description>
  <language>zh-TW</language>
  <lastBuildDate>Thu, 08 Oct 2026 17:22:41 GMT</lastBuildDate>
  <atom:link href="https://aiwulin.itsmygo.uk/tools/gpt-2/rss.xml" rel="self" type="application/rss+xml"/>
  <item>
    <title>【TAICA_生成式AI：文字與圖像生成的原理與實務】4. LLM只是在猜下一個字</title>
    <link>https://aiwulin.itsmygo.uk/c/0d8a472c59/</link>
    <guid isPermaLink="false">aiwulin-0d8a472c59</guid>
    <pubDate>Tue, 29 Sep 2026 00:00:00 +0800</pubDate>
    <dc:creator>Iveai - I've AI</dc:creator>
    <description>&lt;p&gt;深入解析大型語言模型透過預測下一個字來生成文字與影像的原理，涵蓋從 RNN 到 Transformer 的演變、機率抽樣機制及提示詞技巧。觀眾能理解模型背後的數學核心，並學習如何設計有效提示詞以提升生成品質。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=ky59tPI9F9o&quot;&gt;https://www.youtube.com/watch?v=ky59tPI9F9o&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>大型語言模型入門</category>
  </item>
  <item>
    <title>We Let Claude Code and Codex Race Human Researchers — Elie Bakouch, Prime Intellect</title>
    <link>https://aiwulin.itsmygo.uk/c/593cd0265e/</link>
    <guid isPermaLink="false">aiwulin-593cd0265e</guid>
    <pubDate>Sun, 27 Sep 2026 00:00:00 +0800</pubDate>
    <dc:creator>AI Engineer</dc:creator>
    <description>&lt;p&gt;Elie Bakouch 展示 Claude Code 與 Codex 在 Optimizer Speedrun 中超越人類紀錄的表現，兩者策略迥異。影片探討自動 AI 研究現況與未來自進化路徑。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=oVsEddfhdxc&quot;&gt;https://www.youtube.com/watch?v=oVsEddfhdxc&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>Claude Code</category>
    <category>Coding Agent</category>
  </item>
  <item>
    <title>tokenizers v1: encode, decode and scaling, measured</title>
    <link>https://aiwulin.itsmygo.uk/c/eb792e0fc3/</link>
    <guid isPermaLink="false">aiwulin-eb792e0fc3</guid>
    <pubDate>Mon, 21 Sep 2026 00:00:00 +0800</pubDate>
    <dc:creator>Hugging Face Blog</dc:creator>
    <description>&lt;p&gt;介紹 tokenizers v1 如何透過位元流分割、字詞快取與合併迴路重寫，將編碼速度提升數倍至數十倍。讀者可了解其最佳化原理與 Rust 實作細節，並掌握如何安裝與使用新版本。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://huggingface.co/blog/tokenizers-v1&quot;&gt;https://huggingface.co/blog/tokenizers-v1&lt;/a&gt;&lt;/p&gt;</description>
    <category>文章</category>
    <category>從零打造語言模型</category>
    <category>推論與部署</category>
  </item>
  <item>
    <title>三个月后的AI很难预测 | OpenAI研究员诺姆·布朗 | 多智能体集群与递归自我改进 | 思维链监控 | 千禧年大奖难题 | Hugging Face | 强化学习 | 测试时计算</title>
    <link>https://aiwulin.itsmygo.uk/c/8f73111d62/</link>
    <guid isPermaLink="false">aiwulin-8f73111d62</guid>
    <pubDate>Sat, 19 Sep 2026 00:00:00 +0800</pubDate>
    <dc:creator>Best Partners TV</dc:creator>
    <description>&lt;p&gt;OpenAI 研究員諾姆·布朗解析多智慧體系統如何透過並行思考解決千禧年大獎難題，並探討思維鏈監控的脆弱性與預訓練及強化學習的相乘效應。觀眾可了解 AI 加速演進的技術路徑、組織協作模式及未來安全挑戰。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=U8IOTZ-8UIA&quot;&gt;https://www.youtube.com/watch?v=U8IOTZ-8UIA&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>AI Agent 基礎</category>
    <category>多代理系統</category>
    <category>強化學習</category>
  </item>
  <item>
    <title>Why Diffusion Will Win AI Inference with Inception Co-Founder and CEO Stefano Ermon</title>
    <link>https://aiwulin.itsmygo.uk/c/c6269e47b2/</link>
    <guid isPermaLink="false">aiwulin-c6269e47b2</guid>
    <pubDate>Fri, 18 Sep 2026 00:00:00 +0800</pubDate>
    <dc:creator>No Priors</dc:creator>
    <description>&lt;p&gt;訪談 Inception 創辦人 Stefano Ermon，探討他如何將擴散模型應用於文字與程式碼生成，並解釋為何擴散架構在推理速度上優於自迴歸模型。內容涵蓋從學術研究到商業化部署的經驗，以及未來 AI 競爭將由效率決定的觀點。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://traffic.megaphone.fm/PDP7720707490.mp3&quot;&gt;https://traffic.megaphone.fm/PDP7720707490.mp3&lt;/a&gt;&lt;/p&gt;</description>
    <category>Podcast</category>
    <category>推論與部署</category>
    <category>圖像生成</category>
  </item>
  <item>
    <title>Pretraining progress is mostly coming from data</title>
    <link>https://aiwulin.itsmygo.uk/c/3978b8b7d6/</link>
    <guid isPermaLink="false">aiwulin-3978b8b7d6</guid>
    <pubDate>Wed, 09 Sep 2026 00:00:00 +0800</pubDate>
    <dc:creator>Dwarkesh Patel</dc:creator>
    <description>&lt;p&gt;分析 2019 至 2025 年預訓練進度的資料與模型貢獻，發現資料最佳化帶來的效能提升遠高於模型架構改進。研究透過實作不同年份的模型配方與資料集，評估在 OLMES 指標下的表現，指出資料工程對小模型至關重要，而大模型則更能容納雜訊。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data&quot;&gt;https://www.dwarkesh.com/p/pretraining-progress-is-mostly-data&lt;/a&gt;&lt;/p&gt;</description>
    <category>文章</category>
    <category>從零打造語言模型</category>
    <category>大型語言模型入門</category>
    <category>訓練資料與合成資料</category>
  </item>
  <item>
    <title>If Developers Build on Chinese Open-Weight Models, Who Leads AI?</title>
    <link>https://aiwulin.itsmygo.uk/c/8e3c6f2044/</link>
    <guid isPermaLink="false">aiwulin-8e3c6f2044</guid>
    <pubDate>Mon, 03 Aug 2026 00:00:00 +0800</pubDate>
    <dc:creator>Vanishing Gradients</dc:creator>
    <description>&lt;p&gt;Hugo Bowne-Anderson 與 Sebastian Raschka 探討開放權重模型的重要性，指出其能避免對單一廠商的依賴並促進競爭。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://hugobowne.substack.com/p/open-weight-ai-is-becoming-infrastructure&quot;&gt;https://hugobowne.substack.com/p/open-weight-ai-is-becoming-infrastructure&lt;/a&gt;&lt;/p&gt;</description>
    <category>Podcast</category>
    <category>開源模型</category>
    <category>本機跑模型</category>
  </item>
  <item>
    <title>#490 – State of AI in 2026: LLMs, Coding, Scaling Laws, China, Agents, GPUs, AGI</title>
    <link>https://aiwulin.itsmygo.uk/c/cc657a176b/</link>
    <guid isPermaLink="false">aiwulin-cc657a176b</guid>
    <pubDate>Sun, 01 Feb 2026 00:00:00 +0800</pubDate>
    <dc:creator>Lex Fridman Podcast</dc:creator>
    <description>&lt;p&gt;訪談兩位頂尖 AI 研究學者，深入探討 2026 年 AI 發展現狀、規模定律、訓練流程及開源與閉源模型。內容涵蓋從基礎原理到職業建議，幫助讀者理解 AI 技術演進並規劃學習路徑。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://lexfridman.com/ai-sota-2026&quot;&gt;https://lexfridman.com/ai-sota-2026&lt;/a&gt;&lt;/p&gt;</description>
    <category>Podcast</category>
    <category>大型語言模型入門</category>
    <category>AGI 與長期趨勢</category>
    <category>AI Agent 基礎</category>
  </item>
  <item>
    <title>From GPT-2 to gpt-oss: Analyzing the Architectural Advances</title>
    <link>https://aiwulin.itsmygo.uk/c/6d3011a0c9/</link>
    <guid isPermaLink="false">aiwulin-6d3011a0c9</guid>
    <pubDate>Sat, 09 Aug 2025 00:00:00 +0800</pubDate>
    <dc:creator>Sebastian Raschka（部落格）</dc:creator>
    <description>&lt;p&gt;分析 OpenAI 最新推出的 gpt-oss 系列開源大型語言模型架構，對比 GPT-2 與 Qwen3，解釋移除 Dropout、使用 RoPE、SwiGLU 等技術細節。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the&quot;&gt;https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the&lt;/a&gt;&lt;/p&gt;</description>
    <category>文章</category>
    <category>開源模型</category>
    <category>Transformer 原理</category>
    <category>大型語言模型入門</category>
  </item>
  <item>
    <title>Greedy? Min-p? Beam Search? How LLMs Actually Pick Words – Decoding Strategies Explained</title>
    <link>https://aiwulin.itsmygo.uk/c/26fc3a550e/</link>
    <guid isPermaLink="false">aiwulin-26fc3a550e</guid>
    <pubDate>Sun, 03 Aug 2025 00:00:00 +0800</pubDate>
    <dc:creator>AI Coffee Break with Letitia</dc:creator>
    <description>&lt;p&gt;拆解大型語言模型如何從機率分佈選擇下一個字元，涵蓋貪婪解碼、Top-k、Top-p 及 Min-p 等策略。透過 GPT-2 實作示範，說明不同解碼方式如何影響輸出品質與創意。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=o-_SZ_itxeA&quot;&gt;https://www.youtube.com/watch?v=o-_SZ_itxeA&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>大型語言模型入門</category>
  </item>
  <item>
    <title>【生成式AI時代下的機器學習(2025)】第六講：生成式人工智慧的後訓練(Post-Training)與遺忘問題</title>
    <link>https://aiwulin.itsmygo.uk/c/33f5aa4f37/</link>
    <guid isPermaLink="false">aiwulin-33f5aa4f37</guid>
    <pubDate>Sun, 20 Apr 2025 00:00:00 +0800</pubDate>
    <dc:creator>Hung-yi Lee</dc:creator>
    <description>&lt;p&gt;李宏毅教授深入解析生成式 AI 的後訓練（Post-Training）與遺忘問題，說明如何為通用模型注入特定技能。課程探討了避免模型在學習新任務時遺忘原有能力的策略，並介紹了過濾難產生 Token 的技術。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=Z6b5-77EfGk&quot;&gt;https://www.youtube.com/watch?v=Z6b5-77EfGk&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>大型語言模型入門</category>
  </item>
  <item>
    <title>Deep Dive into LLMs like ChatGPT</title>
    <link>https://aiwulin.itsmygo.uk/c/a21885e6d0/</link>
    <guid isPermaLink="false">aiwulin-a21885e6d0</guid>
    <pubDate>Thu, 06 Feb 2025 00:00:00 +0800</pubDate>
    <dc:creator>Andrej Karpathy</dc:creator>
    <description>&lt;p&gt;Andrej Karpathy 深入解析大型語言模型（LLM）的訓練架構、心理機制與實際應用技巧。影片涵蓋從預訓練到後訓練的完整流程，幫助讀者理解模型運作原理並提升使用效率。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=7xTGNNLPyMI&quot;&gt;https://www.youtube.com/watch?v=7xTGNNLPyMI&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>大型語言模型入門</category>
  </item>
  <item>
    <title>Let's reproduce GPT-2 (124M)</title>
    <link>https://aiwulin.itsmygo.uk/c/104e788eb1/</link>
    <guid isPermaLink="false">aiwulin-104e788eb1</guid>
    <pubDate>Mon, 10 Jun 2024 00:00:00 +0800</pubDate>
    <dc:creator>Andrej Karpathy</dc:creator>
    <description>&lt;p&gt;由 Andrej Karpathy 示範如何從零開始重現 GPT-2 (124M) 模型，涵蓋網路構建、訓練最佳化與實際運算過程。觀眾可學習如何建立大型語言模型並執行訓練。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=l8pRSuU81PU&quot;&gt;https://www.youtube.com/watch?v=l8pRSuU81PU&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>大型語言模型入門</category>
    <category>從零打造語言模型</category>
  </item>
  <item>
    <title>Language Modeling Reading List (to Start Your Paper Club)</title>
    <link>https://aiwulin.itsmygo.uk/c/15ef2a7c04/</link>
    <guid isPermaLink="false">aiwulin-15ef2a7c04</guid>
    <pubDate>Sun, 07 Jan 2024 00:00:00 +0800</pubDate>
    <dc:creator>Eugene Yan（部落格）</dc:creator>
    <description>&lt;p&gt;整理一份語言模型領域的經典論文清單，每篇都附有一句話的核心摘要。讀者可以透過這份清單快速了解 Transformer、大型語言模型、提示工程及相關技術的關鍵概念，並建立自己的論文閱讀俱樂部。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://eugeneyan.com//writing/llm-reading-list&quot;&gt;https://eugeneyan.com//writing/llm-reading-list&lt;/a&gt;&lt;/p&gt;</description>
    <category>文章</category>
    <category>大型語言模型入門</category>
    <category>Transformer 原理</category>
    <category>提示工程</category>
  </item>
  <item>
    <title>What is a Transformer? (Transformer Walkthrough Part 1/2)</title>
    <link>https://aiwulin.itsmygo.uk/c/f162e2ba11/</link>
    <guid isPermaLink="false">aiwulin-f162e2ba11</guid>
    <pubDate>Tue, 02 May 2023 00:00:00 +0800</pubDate>
    <dc:creator>Neel Nanda</dc:creator>
    <description>&lt;p&gt;由 Neel Nanda 解說 Transformer 架構的基本概念與運作原理，透過實作 GPT-2 示範如何從零開始理解模型內部機制。觀眾能掌握 Transformer 的核心邏輯，為深入學習機器學習奠定基礎。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=bOYE6E8JrtU&quot;&gt;https://www.youtube.com/watch?v=bOYE6E8JrtU&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>Transformer 原理</category>
  </item>
  <item>
    <title>Implementing GPT-2 From Scratch (Transformer Walkthrough Part 2/2)</title>
    <link>https://aiwulin.itsmygo.uk/c/d578219d5d/</link>
    <guid isPermaLink="false">aiwulin-d578219d5d</guid>
    <pubDate>Tue, 02 May 2023 00:00:00 +0800</pubDate>
    <dc:creator>Neel Nanda</dc:creator>
    <description>&lt;p&gt;由 Neel Nanda 講解如何從零實現 GPT-2，涵蓋 LayerNorm、嵌入、注意力機制與 MLP 等核心步驟。觀眾能透過影片掌握 Transformer 架構的實際程式設計與運作原理。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://www.youtube.com/watch?v=dsjUDacBw8o&quot;&gt;https://www.youtube.com/watch?v=dsjUDacBw8o&lt;/a&gt;&lt;/p&gt;</description>
    <category>影片</category>
    <category>Transformer 原理</category>
    <category>從零打造語言模型</category>
  </item>
  <item>
    <title>Generalized Language Models</title>
    <link>https://aiwulin.itsmygo.uk/c/0e65d84353/</link>
    <guid isPermaLink="false">aiwulin-0e65d84353</guid>
    <pubDate>Thu, 31 Jan 2019 00:00:00 +0800</pubDate>
    <dc:creator>Lilian Weng（部落格）</dc:creator>
    <description>&lt;p&gt;回顧 2018 年自然語言處理的突破性進展，介紹了 GPT、BERT、ELMo 等預訓練語言模型的架構與原理。讀者能理解無監督預訓練如何解決標籤資料需求，並掌握不同模型在下游任務中的應用方式。&lt;/p&gt;&lt;p&gt;原站：&lt;a href=&quot;https://lilianweng.github.io/posts/2019-01-31-lm&quot;&gt;https://lilianweng.github.io/posts/2019-01-31-lm&lt;/a&gt;&lt;/p&gt;</description>
    <category>文章</category>
    <category>大型語言模型入門</category>
    <category>從零打造語言模型</category>
    <category>Transformer 原理</category>
  </item>
</channel>
</rss>
