跳到主要內容
AI 武林
影片入門中文4.6 萬 次觀看

【生成式AI導論 2024】第13講:淺談大型語言模型相關的安全性議題 (上) — 亡羊補牢、語言模型的偏見、有多少人用 ChatGPT 寫論文審查意見

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

探討大型語言模型的安全議題,包括幻覺問題、事實查核機制、偏見檢測方法以及利用浮水印驗證生成內容。觀眾可學習如何評估模型可靠性、檢測潛在偏見及辨識 AI 生成文字。

This course covers safety issues in large language models, including hallucinations, bias detection, and watermarking techniques.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 大型語言模型仍會犯錯,需透過事實查核與安全層驗證輸出。
  • 模型可能帶有性別、種族或職業的偏見,需透過 Benchmark 檢測。
  • 可透過浮水印技術讓使用者辨識內容是否由 AI 生成。

章節

依話題轉折切分,標題由 AI 產生

  1. 00:00大型語言模型幻覺問題與文獻指引
  2. 02:05事實查核機制與事實檢核工具介紹
  3. 07:11偏見檢測方法與情感分析比對策略
  4. 12:29RLHF 訓練機制與履歷審查偏見實驗
  5. 16:13名字嵌入差異與職業刻板印象案例
  6. 21:24亡羊補牢策略與 AI 生成內容偵測方法
  7. 25:05國際會議審查意見中 ChatGPT 使用比例
  8. 28:51透過浮水印與機率規則偵測生成內容

提到的工具與公司

  • GPT-4
  • Gemini
  • FactScore
  • FacTool
  • DeFacecode
  • Text.io
  • ChatGPT

適合誰看

從事 AI 開發、內容審查或需要評估模型安全性的專業人士。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.46
新鮮
0.03

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)