alignment · 幻觉 · 偏见 · 谄媚 · 过度自信
很多人觉得"做了 RLHF 就对齐了"。真相是:RLHF 把模型的偏好往"该说的"拉了拉,但没消除四种典型失败——幻觉(编造事实)、偏见(歧视输出)、谄媚(附和用户错误)、过度自信(把不确定当确定)。RLHF 只是基线,每种失败要专门的补救。
关键认知:对齐不是"训练完就齐了",是"训练拉基线 + 工程层补救"的组合。RLHF 拦不住幻觉——模型还是会编引用,要靠 RAG 给它事实依据;RLHF 拦不住谄媚——模型还是会附和用户,要靠一致性检查检测附和。最后一道闸永远在工程层。
这也是为什么前 7 期讲的全是工程层防御——它们才是真正拦住失败的那道闸。RLHF 让模型"大部分时候说对的",工程层让模型"说错的时候兜得住"。
下面是四种典型对齐失败。选一个,切补救档,点"看模型怎么说",看它怎么错、哪道闸能拦。
演示里"RLHF+对应补救"档能拦住全部,因为每种失败都配了专门的补救——RLHF 拉基线,补救对症下药:
关键认知:这四种补救是正交的——RAG 管事实、宪法 AI 管原则、一致性管立场、置信度管不确定。各管一摊,叠起来才把对齐失败压到最低。单做 RLHF 等于只拉了基线,没补任何一种。