内容摘要
对齐与安全 · RLHF 之外的最后一道闸 灏 灏天文库 · AI 安全与攻防 第 8 期 · 本季终篇 AI 安全与攻防 · 第 8 期 · 本季终篇 对齐与安全 · RLHF 之外的 最后一道闸 alignment · 幻觉 · 偏见 · 谄媚 · 过度自信 RLHF 不是终点,是起点。对齐失败有四种典型形态—— 幻觉、偏见、谄媚、过度自信 ——每种都要对应的补救手段:RAG 治幻觉、宪法 AI 治偏见、一致性检查治谄媚、置信度校准治过度自信。RLHF 只拉基线, 最后一道闸在工程层 。 ⏱ 约 10 分钟 🎯 关心模型层安全的工程师 📦 源:Anthropic Constitutional AI 01 反共识:RLHF 是起点,不是终点 很多人觉得"做了 RLHF 就对齐了"。真相是:RLHF 把模型的偏好往"该说的"拉了拉,但 没消除 四种典型失败——幻觉(编造事实)、偏见(歧视输出)、谄媚(附和用户错误)、过度自信(把不确定当确定)。RLHF 只是基线,每种失败要专门的补救。 关键认知:对齐不是"训练完就齐了",是"训练拉基线 + 工程层补救"的组合。