Up to 3.2x Faster Inference with LFM2.5-DSpark
LFM2.5-DSpark 結合 Flash 與 Markov 頭部,將推理速度提升 3.2 倍至 H100,並降低 MacBook 端 57% 的函式呼叫延遲。
依人氣
LFM2.5-DSpark 結合 Flash 與 Markov 頭部,將推理速度提升 3.2 倍至 H100,並降低 MacBook 端 57% 的函式呼叫延遲。
介紹了 Hugging Face 的 Transformers 現在支援從預訓練檔直接執行 llama.cpp 的量化模型。透過重新利用 ggml 的金屬核,使用者可以在 Mac 上輕鬆執行 Qwen3.5 等模型。
探討 AI 代理在執行任務時的一致性問題,指出平均準確率可能高,但重複執行相同任務時失敗率卻高。作者提出 Consistency Analyzer 工具,透過重現決策過程來識別不穩定的步驟,並生成一致性指南。
介紹了英國 AI 安全研究所(AISI)與 EvalEval 合作,透過「Every Eval Ever」共享架構與「Evaluation Cards」平台,將benchmark 評測結果的透明度和可重複性提升。
介紹了 ACE(Agentic Context Engineering)與 ALTK-Evolve 兩種 AI 代理記憶系統。
Holo4 是 Hugging Face 推出的新一代通用電腦使用代理模型系列,提供 27B 和 35B-A3B 兩種大小,並支援 Holotron4 Nano。
LFM2.5-VL-DSpark 是一款專為加速視覺語言模型推理設計的擴充模型,僅增加 8.9% 引數即可提升 2.6 倍至 3.1 倍的推理速度。該模型支援 Llama.cpp、MLX-VLM 及 SGLang 等工具,並提供即時支援。
介紹了基於 Sentence Transformers 的「多向量(Late Interaction)」嵌入模型,如 LightOn 的 LateOn 和 mLateOn。
介紹了 Gradio 內建的 gr.Workflow 功能,它將程式碼流程轉化為可拖曳的圖形介面。使用者可以將輸入、運算步驟和輸出連線成網狀結構,並透過 REST API 直接呼叫。
介紹了 ProvenanceGuard,一款用於 MCP 代理的源感知驗證工具。該工具能識別並驗證答案來源是否正確,避免將不同來源的資訊錯誤歸屬。
依發布時間
介紹了 Olmo-core 3,這是 Hugging Face 推出的大型混合專家(MoE)訓練架構升級版。它旨在將訓練規模擴充套件至十億引數級別,同時保持計算效率。
介紹了 Open TTS Leaderboard,旨在解決開放源 TTS 模型評測碎片化問題。該板塊使用視覺化指標(如 WER、RTFx、SIM)替代傳統的人工偏好評分,讓評測更快速且具可比性。
NVIDIA Kumo Tabular 是一款開源表格基礎模型,能在單次前向推論中直接預測新資料標籤,無需訓練或特徵工程。它基於表格結構設計,支援分類與回歸,並率先在 TabArena 等四個指標中取得最佳成績。
介紹了 ProvenanceGuard,一款用於 MCP 代理的源感知驗證工具。該工具能識別並驗證答案來源是否正確,避免將不同來源的資訊錯誤歸屬。
Holo4 是 Hugging Face 推出的新一代通用電腦使用代理模型系列,提供 27B 和 35B-A3B 兩種大小,並支援 Holotron4 Nano。
LFM2.5-VL-DSpark 是一款專為加速視覺語言模型推理設計的擴充模型,僅增加 8.9% 引數即可提升 2.6 倍至 3.1 倍的推理速度。該模型支援 Llama.cpp、MLX-VLM 及 SGLang 等工具,並提供即時支援。
介紹了 Hugging Face 的 Transformers 現在支援從預訓練檔直接執行 llama.cpp 的量化模型。透過重新利用 ggml 的金屬核,使用者可以在 Mac 上輕鬆執行 Qwen3.5 等模型。
介紹了英國 AI 安全研究所(AISI)與 EvalEval 合作,透過「Every Eval Ever」共享架構與「Evaluation Cards」平台,將benchmark 評測結果的透明度和可重複性提升。
oMLX 創作者兼維護者 Jun Kim 加入 Hugging Face,將致力於支援 MLX 社群。oMLX 是 Apple 本地 AI 框架,目前由 Hugging Face 作為模型庫與貢獻者平台。
介紹了 Hugging Face 的 tokenizers v1 版本,該版本在保持 API 和輸出不變的前提下,將編碼速度提升 3 至 30 倍。
探討 AI 代理在執行任務時的一致性問題,指出平均準確率可能高,但重複執行相同任務時失敗率卻高。作者提出 Consistency Analyzer 工具,透過重現決策過程來識別不穩定的步驟,並生成一致性指南。
介紹了使用 AsyncGRPOTrainer 與 LoRA 技術,在 Hugging Face Jobs 架構下實現跨節點訓練的方法。
介紹了 Gradio Workflow 如何重構 AUTOMATIC1111 的穩定 Diffusion WebUI。作者展示了 Workflow1111,一個包含 11 個媒體管道、73 個節點的圖形工作流,整合了文生圖、高解析度修復…
介紹了 NeoMME,一個雙語雙模態基礎編碼器,採用單一 Transformer 架構處理文字與圖片。它不使用預訓練的視覺塔或因果語言模型,而是從頭訓練,並使用掩碼離散擴散目標。
介紹了 Surya Narreddi 的實驗,他使用 TRL 框架和 OpenEnv 環境,訓練一個程式設計模型來繪製水彩畫。模型透過 p5.brush 庫生成 JavaScript 程式碼,並依據手評池中的 178 幅作品進行反饋學習。
介紹如何透過 GRPO 自訂訓練將 350M 引數模型提升為結構化輸出專家。透過設計針對 JSON/YAML 格式與欄位數的獎勵函式,在 100 步內即可讓模型從 22.6% 提升至 29.7% 的結構正確率,證明小模型也能透過精細化訓練…
介紹了 Funes,一個專為 AI 程式設計代理設計的持久化記憶層。它利用本地 Lance 資料集和向量搜尋,讓代理能自主檢索過去決策、理據與細節,無需手動整理上下文。
介紹了 BenchMIRT,一種用於審計 LLM 個體提示的測試方法。該方法基於專案反應理論(IRT),能將單一分數中的不同能力訊號分離出來,例如區分安全與一般推理。
介紹了 Hugging Face 推出的 WebGPU 核心庫 @huggingface/kernels,提供 207 個經過最佳化且版本化的 WebGPU 核碼。
Open ASR Leaderboard 新增印度英語與印地語兩個全球南方語言測試集,透過詳細的地理、人口與裝置資訊,讓讀者能追蹤模型在不同區域與口音下的準確率差異。
介紹如何使用 Sentence Transformers 訓練和微調多向量嵌入模型,以實現類似 ColBERT 的晚互動檢索。
Granite 4.2 是 Granite 系列的首個稠密推理 LLM 家族,提供 3B、8B 和 30B 三種規模。它們採用自研的五階段訓練策略,從 15T token 上無預留訓練開始,經過 SFT 和多階段 RL 訓練。
介紹了 Quantization-Aware Healing (QAH),一種能修復結構壓縮與量化損傷的 4-bit 模型方法。
介紹了 Gradio 內建的 gr.Workflow 功能,它將程式碼流程轉化為可拖曳的圖形介面。使用者可以將輸入、運算步驟和輸出連線成網狀結構,並透過 REST API 直接呼叫。
介紹了 Papers with Code 如何利用 Hugging Face 的 Inference Endpoints、Jobs 和 Buckets 構建強大的搜尋系統。
探討了語音識別中「benchmark 最佳化」現象,即模型傾向於重現參考資料集中的錯誤或特定拼寫,而非準確聽寫。研究透過三項測試(共識分歧探測、掩碼數字測試、正字法切換測試)量化此問題,發現部分模型會根據參考資料的音訊特徵或拼寫習慣調整輸…
LFM2.5-DSpark 結合 Flash 與 Markov 頭部,將推理速度提升 3.2 倍至 H100,並降低 MacBook 端 57% 的函式呼叫延遲。
探討 AI 代理的記憶機制,指出記憶並非通用功能,而是需根據模型能力進行劑量調整。透過 ALTK-Evolve 庫,可從代理過往軌跡中 distilled 指導原則並注入推理時,無需更新權重。
介紹了基於 Sentence Transformers 的「多向量(Late Interaction)」嵌入模型,如 LightOn 的 LateOn 和 mLateOn。
介紹了 Hugging Face 開發的 GPU 分發器,透過改變分配順序而非單純增加資源,讓 GPU 利用率提升 33 個百分點。該系統將彈性推理與批處理工作結合,並透過嚴格的約束函式與時間衰減權重,確保高優先順序任務不被延遲。
分析了 2026 年夏季 Hugging Face 開放模型生態的現狀。中國實驗室在模型規模上已超越美國,並透過量化技術讓大模型更易部署。
介紹如何使用 Strands Agents 與 LeRobot 結合 Hugging Face Storage Buckets,實現從記錄演示到訓練再到部署的完整資料迴圈。
介紹了 Hugging Face 舉辦的 ICML 2026 開源重現挑戰,超過 1,200 名成員在 19 天內重現了 2,226 篇論文。
介紹了 OlmoEarth Studio 推出的可定製嵌入輸出功能,允許使用者將地球觀測資料轉換為緊湊的數值向量。這些嵌入支援多種下游任務,如相似性搜尋、分割及無監督探索。
介紹了 ACE(Agentic Context Engineering)與 ALTK-Evolve 兩種 AI 代理記憶系統。
介紹 NVIDIA Magpie TTS,一款支援 12 種語言的開放權重多語音合成模型。透過自定義部署架構,使用者可完全掌控延遲,並針對自家硬體最佳化效能。
介紹了如何透過最佳化知識蒸餾(Knowledge Distillation)流程,大幅降低其計算與記憶體成本。作者提出兩種系統性改動:將教師模型的 logits 預先儲存並僅在訓練時使用,以及採用分塊計算的 KL 散度損失,避免一次性構建…
Meta 推出 Muse Glimmer 30B 多模態模型,支援本地執行、代理式任務、多模態輸入及開放原始碼。該模型結合 ViT 編碼器與 DFlash 猜測解碼,在推理效能與程式碼生成等任務上表現優異,並提供完整的部署與最佳化指南。
Baseten 正式支援 Hugging Face Hub 的推理提供者,讓開發者能在模型頁面直接存取。透過 Hugging Face SDK 或 Agent Harness,可無縫整合 DeepSeek V4 Flash、GLM-5.2…
探討了 AI 產業中,GPU 利用率成為新的瓶頸。與過去航空業以地面時間衡量生存能力不同,現在企業 AI 的競爭焦點轉向如何最大化 GPU 的實際運算效率。