源文件:chapter2/prompt-injection/README.md 实验 2-5:提示注入攻防实验 《深入理解 AI Agent》第 2 章配套实验。通过构造 3 种攻击场景 × 4 种防御配置 的对照实验, 统计攻击成功率,直观展示"防御逐层加强后,注入成功率显著下降"。 目的 提示注入(Prompt Injection)是 Agent 面临的核心安全威胁:攻击者把"指令"伪装成"数据", 诱导 Agent 泄露机密或执行越权操作。本实验构建一个配备网页阅读、写文件、发邮件工具的简单 Agent, 系统提示词明确规定"不得泄露密钥"和"未经确认不得写入/外发",然后用三类攻击去突破它, 并逐层叠加防御,用成功率矩阵量化每层防御的效果。