看影片(在新分頁開啟原站)連到 Hung-yi Lee
摘要
深入探討大型語言模型面臨的欺騙風險,區分「越獄」與「提示注入」兩種攻擊手法。透過實際範例與最新研究,說明如何繞過模型防禦機制,並提醒使用者注意潛在的隱私洩漏與安全隱患。
This lecture explains prompt hacking techniques like jailbreaking and prompt injection to bypass LLM safety filters and extract private data.
摘要、重點與章節標題由語言模型整理,細節(誰說的、數字、先後)可能有誤;要引用請以原始內容為準。
重點
- 越獄旨在讓模型說出不該說的話,提示注入則讓應用怠忽職守。
- 利用陌生語言、衝突指令或故事說服可繞過模型防禦。
- 重複特定單字可能誘發模型洩露訓練資料中的個人隱私。
章節
依話題轉折切分,標題由 AI 產生
提到的工具與公司
- GPT-3.5
- GPT-4
- GPT-4-O
- GPT-4o
- Dan
適合誰看
正在學習機器學習、開發 AI 應用或關注大模型安全性的技術人員與學生。
摘要依據
- 講者
- 李宏毅
- 依據
- 人工字幕
為什麼排在這裡
- 人氣
- 0.43
- 新鮮
- 0.04
在主題頁與搜尋結果裡,名次由相關、人氣、新鮮三個分數決定;這一頁沒有搜尋的關鍵字,所以沒有相關分數。排序怎麼算
相關內容
- Breaking LLM Applications – Advances in Prompt Injection Exploitation影片 ・ HITCON ・ 41 分鐘(在新分頁開啟原站)
- Prompt Injections in the Wild - Exploiting Vulnerabilities in LLM Agents | HITCON CMT 2023影片 ・ HITCON ・ 42 分鐘(在新分頁開啟原站)
- Stealing Reasoning Traces from Proprietary LLM APIs — Ilia Shumailov & Alexander PanfilovPodcast ・ Machine Learning Street Talk ・ 49 分鐘
- 【生成式AI導論 2024】第13講:淺談大型語言模型相關的安全性議題 (上) — 亡羊補牢、語言模型的偏見、有多少人用 ChatGPT 寫論文審查意見影片 ・ Hung-yi Lee ・ 32 分鐘
- Adversarial Attacks on LLMs文章 ・ Lilian Weng(部落格)
- 如何从专有LLM API中窃取推理痕迹 | LLM安全 | 推理痕迹 | 大语言模型 | AI安全 | 越狱攻击 | 模型蒸馏 | 推理模型 | 加密推理 | 隐私泄露 | 提示注入影片 ・ Best Partners TV ・ 16 分鐘(在新分頁開啟原站)
摘要由 AI 根據原文產生,可能有誤;完整內容請看原站。看影片(在新分頁開啟原站)
