跳到主要內容
AI 武林

Transformer 原理

Transformers ・ 29 筆內容

注意力機制與 Transformer 架構,現代語言模型的基礎。

也叫做:transformer、transformers、注意力機制、attention、self-attention、自注意力、位置編碼

排行前 8 名

依相關、人氣、新鮮度綜合排序;站長推薦的加成

最新

依發布時間

  1. 影片Zhang Xiaojun Podcast進階中文

    152. 领读Kimi K3技术报告:从架构创新聊起,注意力美学、多教师蒸馏和开源MoE(在新分頁開啟原站)

    本集播客由孫宇領讀 Kimi K3 技術報告,該報告提出沿序列、深度與寬度三個維度擴充套件的 MoE 架構。報告指出 K3 透過將注意力機制從 token 切分為值域桶並進行統計,實現了高效擴充套件,同時採用全量訓練以確保訓練穩定性與相容…

    7,616次觀看