Understanding the 4 Main Approaches to LLM Evaluation (From Scratch)
介紹了評估大語言模型(LLM)的四大主流方法:多選題庫、驗證器、排行榜和 LLM 裁判。透過程式碼實作,讀者能理解這些方法的運作原理與優缺點。
部落格 ・ 國際 ・ 英文 ・ A 級 ・ 17 筆內容 ・ 最近更新 2026/09/29
《Build a Large Language Model (From Scratch)》作者
依人氣
介紹了評估大語言模型(LLM)的四大主流方法:多選題庫、驗證器、排行榜和 LLM 裁判。透過程式碼實作,讀者能理解這些方法的運作原理與優缺點。
介紹了近期開源大語言模型(LLM)在長文處理效率上的幾項重要架構創新。主要涵蓋了 Gemma 4 的跨層 KV 共享與每層嵌入、Laguna XS.2 的層級注意力預算、ZAYA1-8B 的壓縮凸積注意力,以及 DeepSeek V4 的…
介紹如何透過本地推理伺服器執行開源權重大語言模型,並搭配本地編寫代理工具(如 Qwen-Code)來替代雲端服務。文章詳述了從安裝 Ollama 到配置隱私設定(禁用追蹤)的完整流程,並探討了透過 SSH 隧道將本地模型部署至遠端硬體(如…
探討了「Jev」模型,一種專為文字分類設計的輕量級語言模型。作者指出,雖然傳統方法如 Bag-of-Words 和深度學習(RNN/CNN)已存在,但 Jev 在處理特定分類任務時比通用大語言模型(LLM)更快且更便宜。
這篇部落格文章詳細介紹了 Qwen3 模型的開發過程,從零開始實作,讓讀者了解大型語言模型的基礎架構。
※ 摘要僅根據標題與說明
這篇文章詳細介紹了 DeepSeek 的 V3.2 模型,包括其稀疏注意力機制、混合推理架構以及針對數學問題的自驗證訓練方法。作者分析了從 V3 到 V3.2 的演進,並探討了 GRPO 最佳化與自反思技術如何提升模型推理能力。
介紹了如何控制大型語言模型(LLM)的推理努力程度,使其具備低、中、高三種模式。透過 RLVR 訓練與推理時排程,模型可根據任務需求切換推理模式。
整理了現代大型語言模型中多種注意力變體,包括多頭注意力、GQA、MLA、滑動窗注意力等。透過視覺化模型卡片,讀者可以了解不同架構如何平衡計算效率與模型效能,特別適合想深入理解 LLM 內部機制或選擇合適架構的開發者。
回顧了 2026 年 1 月至 3 月間十款開放權重大語言模型的十款主要發布,涵蓋了從 3B 到 1T 引數的各種架構。文章重點分析了 Arcee Trinity Large、Moonshot Kimi K2.5、StepFun Step…
依發布時間
探討了「Jev」模型,一種專為文字分類設計的輕量級語言模型。作者指出,雖然傳統方法如 Bag-of-Words 和深度學習(RNN/CNN)已存在,但 Jev 在處理特定分類任務時比通用大語言模型(LLM)更快且更便宜。
探討了 OpenAI 的 GPT-6 Astra 模型,特別是其優異的電腦使用能力與可能使用的「迴圈轉譯器」架構。文章指出,迴圈轉譯器能在固定計算預算下提升模型效能,並引用最新研究探討迴圈機制如何影響推理過程。
本影片詳細解釋了Claude 如何在其文字生成過程中加入隱形水印,並說明如何檢測與移除這些水印。影片透過從零開始的程式碼實作,深入剖析了 LLM 的隨機樣本機制,並展示了如何透過隨機鍵將隨機數變為可重複的確定性樣本,從而實現水印功能。
介紹如何從零開始,利用 Python 和 TensorFlow 自行開發一個 AI 文字檢測器,涵蓋了資料準備、模型訓練、本地部署及 RLVR 等完整流程。
※ 摘要僅根據標題與說明
介紹了如何控制大型語言模型(LLM)的推理努力程度,使其具備低、中、高三種模式。透過 RLVR 訓練與推理時排程,模型可根據任務需求切換推理模式。
介紹如何透過本地推理伺服器執行開源權重大語言模型,並搭配本地編寫代理工具(如 Qwen-Code)來替代雲端服務。文章詳述了從安裝 Ollama 到配置隱私設定(禁用追蹤)的完整流程,並探討了透過 SSH 隧道將本地模型部署至遠端硬體(如…
介紹了近期開源大語言模型(LLM)在長文處理效率上的幾項重要架構創新。主要涵蓋了 Gemma 4 的跨層 KV 共享與每層嵌入、Laguna XS.2 的層級注意力預算、ZAYA1-8B 的壓縮凸積注意力,以及 DeepSeek V4 的…
※ 摘要僅根據標題與說明
這篇文章詳細介紹了編寫程式碼代理(Coding Agents)的六大核心元件,包括實時專案上下文、提示詞與快取最佳化、結構化工具、上下文壓縮、記憶管理以及子代理分發。
整理了現代大型語言模型中多種注意力變體,包括多頭注意力、GQA、MLA、滑動窗注意力等。透過視覺化模型卡片,讀者可以了解不同架構如何平衡計算效率與模型效能,特別適合想深入理解 LLM 內部機制或選擇合適架構的開發者。
回顧了 2026 年 1 月至 3 月間十款開放權重大語言模型的十款主要發布,涵蓋了從 3B 到 1T 引數的各種架構。文章重點分析了 Arcee Trinity Large、Moonshot Kimi K2.5、StepFun Step…
回顧了 2025 年大語言模型(LLM)的進展、問題與預測。重點包括 DeepSeek R1 與 RLVR/GRPO 演算法的突破,以及推理時擴充套件(inference-time scaling)的重要性。
這篇文章詳細介紹了 DeepSeek 的 V3.2 模型,包括其稀疏注意力機制、混合推理架構以及針對數學問題的自驗證訓練方法。作者分析了從 V3 到 V3.2 的演進,並探討了 GRPO 最佳化與自反思技術如何提升模型推理能力。
介紹了評估大語言模型(LLM)的四大主流方法:多選題庫、驗證器、排行榜和 LLM 裁判。透過程式碼實作,讀者能理解這些方法的運作原理與優缺點。
這篇部落格文章詳細介紹了 Qwen3 模型的開發過程,從零開始實作,讓讀者了解大型語言模型的基礎架構。
※ 摘要僅根據標題與說明
深入分析 OpenAI 推出的 gpt-oss 系列模型,與 GPT-2 進行架構對比,並詳述其移除 Dropout、採用 RoPE、使用 SwiGLU 及 RMSNorm 等技術最佳化的細節。