跳到主要內容
AI 武林
影片入門中文3.1 萬 次觀看

【生成式AI導論 2024】第14講:淺談大型語言模型相關的安全性議題 (下) — 欺騙大型語言模型

來源 Hung-yi Lee人物 李宏毅 Hung-yi Lee

看影片(在新分頁開啟原站)連到 Hung-yi Lee

摘要

深入探討大型語言模型面臨的欺騙風險,區分「越獄」與「提示注入」兩種攻擊手法。透過實際範例與最新研究,說明如何繞過模型防禦機制,並提醒使用者注意潛在的隱私洩漏與安全隱患。

This lecture explains prompt hacking techniques like jailbreaking and prompt injection to bypass LLM safety filters and extract private data.

摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。

重點

  • 越獄旨在讓模型說出不該說的話,提示注入則讓應用怠忽職守。
  • 利用陌生語言、衝突指令或故事說服可繞過模型防禦。
  • 重複特定單字可能誘發模型洩露訓練資料中的個人隱私。

章節

依話題轉折切分,標題由 AI 產生

  1. 03:11針對 GPT-4-O 的越獄 Prompt 實例
  2. 08:15透過文字接龍竊取機密訓練資料
  3. 11:27作業系統中 Prompt Injection 攻擊手法

提到的工具與公司

  • GPT-3.5
  • GPT-4
  • GPT-4-O
  • GPT-4o
  • Dan

適合誰看

正在學習機器學習、開發 AI 應用或關注大模型安全性的技術人員與學生。

摘要依據

講者
李宏毅
依據
人工字幕

為什麼排在這裡

人氣
0.43
新鮮
0.04

在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算

摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)