第2章 输入侧防御:提示词注入的检测与过滤 在第 1 章里,我们把敌人看清楚了:大模型应用之所以"天生脆弱",根本原因在于模型无法从结构上区分"你给我的指令"和"你给我的数据"。攻击者也正是利用这一点,把恶意指令伪装成一段普通文本,混进上下文,让模型乖乖照做。 从这一章开始,我们转入攻防的下半场——怎么防。先说一个重要的认知:防御从来不是一句"请模型保持安全"就能解决的事。它是一条需要层层设防的流水线,每一层都只解决一部分问题,叠加起来才形成真正的护栏。本章聚焦"输入侧",也就是在用户或外部系统的内容真正进入模型上下文之前,我们能做的所有事。 输入侧到底在防谁 要把防御做对,先得把威胁模型想清楚。输入侧要防的有三类来源,它们的共同点是:都可能在你毫无察觉时,把"指令"混进"数据"里。