跳到主要內容
AI 武林
影片進階中文5,005 次觀看

Sakana Fugu 不訓練模型改當指揮官,效能直逼 Anthropic Fable 5? | S2E63

來源 矽谷輕鬆談 Just Kidding Tech

看影片(在新分頁開啟原站)連到 矽谷輕鬆談 Just Kidding Tech

其他版本:Podcast 版(在新分頁開啟)

摘要

Sakana AI 推出「Fugu Ultra」模型,不直接訓練大模型,而是透過一個 7B 參數的「指揮官」模型,排程 Open 4.8、GPT-5.5 及 Gemini 3.1 Pro 等強大模型來組合。該指揮官使用 RL 訓練,目標是生成工作流程而非直接答案,並具備優異的程式碼審查能力。作者實測發現其效能與 Fable 5 相當,但速度慢、耗 Token 且品質提升有限,僅在 Benchmark 上表現較好。

Sakana AI launched the 'Fugu Ultra' model, which does not train large models directly but instead deploys a 7B-parameter 'commander' model to orchestrate powerful models like Open 4.8, GPT-5.5, and Gemini 3.1 Pro. The commander uses RL to generate workflows rather than direct answers and excels in代码…

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • Sakana AI 透過 7B 指揮官模型排程 Open 4.8、GPT-5.5 及 Gemini 3.1 Pro 等強大模型來組合,目標是生成工作流程而非直接
  • 該指揮官使用 RL 訓練,具備優異的程式碼審查能力,但實測顯示速度慢、耗 Token 且品質提升有限。
  • 作者實測發現其效能與 Fable 5 相當,但速度慢、耗 Token 且品質提升有限,僅在 Benchmark 上表現較好。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00Sakana 復古模型:以小模型指揮大模型,效能直逼 Fable 5
  2. 03:53Sakana AI 創辦人背景:Google 頂尖人才與創業故事
  3. 09:20Sakana 復古模型運作原理:7B 指揮官模型如何調配三強模型
  4. 11:52Sakana 復古模型爭議:美國政府與 OpenAI 的強烈反對
  5. 14:25Sakana 復古模型核心哲學:端到端訓練與子任務分發策略

提到的工具與公司

  • Open 4.8
  • GPT-5.5
  • Gemini 3.1 Pro
  • Fable 5

適合誰看

對 AI 模型排程機制、工作流生成及程式碼審查感興趣的開發者與技術研究者。

摘要依據

依據
語音轉文字

為什麼排在這裡

人氣
0.33
新鮮
0.69

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)