可扩展监督与弱到强泛化


文档摘要

可扩展监督与弱到强泛化 本节摘要:Burns 等(OpenAI Superalignment,《Weak-to-Strong Generalization》,2023)为超对齐问题提出了一个代理:用较弱模型产出的标签微调一个强模型。如果强模型能从不完美的弱监督中正确泛化,当前人类规模的对齐方法或许能延伸到超人类系统。可扩展监督与 W2SG 是互补的:可扩展监督(辩论、递归奖励建模、任务分解)提升监督者的有效能力,让它跟得上被监督的模型;W2SG 确保强模型无论监督者提供什么不完美信号,都能正确泛化。《Debate Helps W2SG》(arXiv:2501.13124,2025 年 1 月)把两者结合。本节是第 06-10 节「威胁与控制」之后,让监督者强到足以验证 U 对齐的正向议程。

可扩展监督与弱到强泛化

本节摘要:Burns 等(OpenAI Superalignment,《Weak-to-Strong Generalization》,2023)为超对齐问题提出了一个代理:用较弱模型产出的标签微调一个强模型。如果强模型能从不完美的弱监督中正确泛化,当前人类规模的对齐方法或许能延伸到超人类系统。可扩展监督与 W2SG 是互补的:可扩展监督(辩论、递归奖励建模、任务分解)提升监督者的有效能力,让它跟得上被监督的模型;W2SG 确保强模型无论监督者提供什么不完美信号,都能正确泛化。《Debate Helps W2SG》(arXiv:2501.13124,2025 年 1 月)把两者结合。本节是第 06-10 节「威胁与控制」之后,让监督者强到足以验证 U 对齐的正向议程。

对应原课程:Phase 18 · Lesson 11 · scalable-oversight-weak-to-strong(原英文 phases/18-ethics-safety-alignment/11-scalable-oversight-weak-to-strong/docs/en.md)。前置:Phase 18 · 01、10,Phase 09。

学习目标

阅读完本节,你应当能够:

  1. 定义可扩展监督与弱到强泛化(W2SG),并解释它们如何互补
  2. 描述 Burns 等 2023 的实验设置:用 GPT-2 的标签微调 GPT-4。
  3. 解释性能差距恢复率(PGR)指标及其测量的东西。
  4. 说出三大可扩展监督机制(辩论、递归奖励建模、任务分解)及各自的一个长处。
  5. 阐明什么证据会证伪「弱到强泛化是通往超对齐的可行路径」这一主张。

一、问题与直觉

第 18 章到此为止的每一种对齐技术,都假设监督者能评估模型行为。当模型超人类时,监督者成了薄弱环节。超对齐问题是:一个较弱的监督者能否可靠地产出一个更强、且对齐的模型?

Burns 等把它化简为一个可操作的经验设置:用弱监督强,测量强模型的能力有多少在弱监督下存活。这不是超对齐的解,而是一个让我们测量进展的代理

W2SG:Burns 等的设置

  • 弱模型:GPT-2 级。
  • 强模型:GPT-4 级。
  • 目标:强 GPT-4 在该任务上的上限。

步骤:(1) 拿弱模型在某任务上的零样本预测;(2) 用弱标签微调强模型;(3) 测强微调后模型的准确率。基线:弱模型自身准确率、强模型在金标签上的监督上限。差距指标 PGR = (微调 − 弱) / (上限 − 弱)——PGR=1.0 表示弱监督完全闭合差距;PGR=0 表示弱监督没帮助。

Burns 等的经验发现

跨 NLP、国际象棋谜题、奖励建模任务,PGR 始终为正:强模型超越了弱监督者的错误,泛化到了正确的目标。任务特定的 PGR 从约 20% 到约 80% 不等。强模型从不完美标签中「理解」了意图任务,用预训练先验填补了空白。

Burns 等指出的局限:

  • 这里的弱到强差距是能力差距,不是对齐差距。弱模型是对齐的;真正的超人类模型可能由人类对齐,但能力差距大得多。
  • 强模型的泛化可能更多是关于任务先验,而非恢复真实意图
  • 真正的问题是引出强模型的潜在知识;PGR 测的是一个具体操作化。

可扩展监督:三种机制

  • 辩论(Irving 等 2018):两个 U 实例辩论对立的两面;弱法官裁决。假设:找到一个令人信服的答案比答案容易。2024-2025 工作(Khan 等、Michael 等)显示辩论有时有用有时没用,是否有用取决于任务结构。
  • 递归奖励建模(Leike 等 2018):U 帮助人类为 U+1 训练奖励模型。监督者的有效能力随模型一起增长。
  • 任务分解(Christiano、Shlegeris、Amodei 2018):把难任务分解成人类能检查的子任务,递归进行。假设可分解性。

每种机制都对任务结构或中间组件的对齐性有所假设

为什么可扩展监督与 W2SG 互补

可扩展监督提升监督者的有效信号质量;W2SG 闭合监督者能提供的任何不完美信号留下的差距。Lang 等《Debate Helps Weak-to-Strong Generalization》(arXiv:2501.13124)把两者结合:辩论协议提供更好的弱标签,强模型在这些标签上训练,在 NLP 任务上报告了 PGR 增益。

组织戏剧

OpenAI 的 Superalignment 团队在 2024 年 5 月 Jan Leike 离职加入 Anthropic 后解散。但议程(可扩展监督、W2SG、自动化对齐研究)在 Anthropic 和学术界继续——MATS(第 28 节)、Redwood(第 10 节)、Apollo(第 08 节)、METR(第 28 节)。组织结构变了,研究问题没变

二、从零实现

code/main.py 在合成任务上模拟 W2SG 微调。弱标注者有 70% 准确率且错误有结构;强模型在金标签上有 95% 上限。你用弱标签微调强模型,测 PGR,与「强用金」和「弱单独」对比。

def weak_to_strong(strong, weak_labels, gold, task): strong_ft = finetune(strong, weak_labels) # 用弱标签微调 acc_ft = eval(strong_ft, task) acc_weak = eval(weak_labels, task) acc_ceil = eval_on_gold(strong, gold) PGR = (acc_ft - acc_weak) / (acc_ceil - acc_weak) # 1.0=完全闭合,0=无帮助 return PGR

💡 关键观察:PGR > 0 意味着强模型超越了弱标注者的错误。但 Burns 等警告,这可能是强模型的预训练先验在做填补,而非真正「恢复」了弱标注者想表达的意图。两者在指标上无法区分——这是 W2SG 作为超对齐代理的根本模糊性。

三、框架对比

机制 提升什么 关键假设
辩论 弱法官在两个 U 辩手间裁决 真比假更容易令人信服
递归奖励建模(RRM) U 帮训 U+1 的奖励模型 中间奖励模型对齐
任务分解 把难任务拆成可验证子任务 任务可分解
W2SG 强模型从不完美标签泛化 强先验能填补弱标签空白

设计要点:可扩展监督与 W2SG 是互补的——前者提升监督信号质量,后者闭合残差差距。生产中最有希望的是两者结合(Lang 等 2025):用辩论产弱标签,再用 W2SG 让强模型泛化。但每种机制都对任务结构有假设,跨任务迁移性需逐一验证。

四、可复用产物

本节产出 outputs/skill-w2sg-pgr.md:给它一份监督设置描述,它识别弱监督者、强模型、监督质量,计算(或请求)PGR,并标记主张是「弱能监督强」还是「弱 + 监督机制能监督强」。

code/main.py 是独立玩具,合成任务可换成真实 NLP/编码任务,PGR 计算逻辑不变。

五、练习

  1. Easy:运行 code/main.py,报告弱准确率 0.60、0.70、0.80 下的 PGR,解释 PGR 曲线的形状。

  2. Medium:把弱标注者改成有结构错误(如对某类输入总错)。PGR 上升、下降还是不变?解释。

  3. Medium:读 Burns 等 2023 第 4.3 节(NLP 任务),复现「置信度辅助损失」直觉:当强模型比弱标签更自信时,谁赢?

  4. Hard:设计一个把辩论与任务分解结合的软件工程任务可扩展监督协议。各命名一个组件的失败模式,解释组合是否解决。

  5. Hard:阐明什么会证伪「弱到强泛化是通往超对齐的可行路径」这一主张。具体说明你需要看到的经验签名。

本节要点回顾

  1. 超对齐问题:模型超人类时,监督者是薄弱环节——弱监督者能否产出强且对齐的模型?
  2. W2SG 设置:用 GPT-2 标签微调 GPT-4,PGR=(微调−弱)/(上限−弱),跨任务 PGR 约 20%-80%。
  3. PGR 始终为正:强模型超越弱标注者错误,但可能是预训练先验在填补,而非恢复真实意图——根本模糊性。
  4. 三种可扩展监督机制:辩论(真比假易信)、递归奖励建模(U 训 U+1)、任务分解(可分解性假设),各对任务结构有假设。
  5. 互补关系:可扩展监督提升信号质量,W2SG 闭合残差差距;Lang 等 2025 用辩论 + W2SG 结合获 PGR 增益。
  6. 第 06-11 节弧线:06-09 描述威胁,10 是不信任 U 的防御范式,11 是让监督者强到能验证 U 的正向议程。
  7. 组织延续:OpenAI Superalignment 解散,议程在 Anthropic/MATS/Redwood/Apollo/METR 继续。

下一节,我们转向对抗评估的实用工具——红队 PAIR:一个攻击者 LLM 在约 20 次查询内自动黑盒越狱目标 LLM 的标准范式。


发布者: 作者: Rohit Gupta 转发
评论区 (0)
U