本节摘要:在本文集的坐标系里,伦理与安全首先是目标与合法集的问题:哪些结果不可被效用买通,谁有权改目标,失败时默认行动是什么。可解释性是追溯:能否从一次行动回到当时的状态字段、命中的规则或计划、以及学习版本。偏见来自数据与目标代理指标,落点在 4.1 与 3.1。事故编年与治理流程让位伦理专集;这里只把义务焊回循环接口,避免把「负责任」写成海报。
阅读完本节,你应当能够:
SOURCE 从偏见、隐私、问责、透明谈起。偏见:训练数据与代理目标让策略在群体上系统偏离。落点是 3.1 的目标写错或 4.1 的标签偏了,不是「再加一个公平模块」就能从循环外修好。隐私:观测里含个人数据,状态清单应最小,长期记忆写入要权限。问责:一次行动要能指出当时版本与决策路径。透明:对用户说清系统在做什么,不等于把权重打印出来。四件事都能焊回已有接口,不必新发明一种「伦理层」悬在空中——悬着的层不会拥有执行器否决权。
安全在循环里分两截。约束安全:碰撞、误下单、违规披露,用 L0 与反射否决。信息安全:谁能读状态、谁能写知识、工具合法集是否含危险 API。两截都失败过的系统,往往只做了前者的演示急停,忘了后者的工具权限。6.2 的工具循环在此必须接合法集。
行动 a 被执行前: 通过 L0 约束? 工具在合法集? 当前意图仍有效? 否则: 安全默认,并记录否决原因
💡 关键直觉:伦理要求能改变行动,才算进了循环。只改变仪表盘文案,是 2.4 说过的展览式理解。
一次出库插货刮损,追溯应能回答:当时状态里易碎字段是什么、技能层选了哪个角度、反射有没有否决、知识版本号、奖励是否在训练里鼓励过快。答得出,才谈得上问责与改进。答不出,事后生成一段「因为综合考虑」,是流畅的雾。符号规则与计划天然好追;向量策略要靠探针、特征归因或对照实验,成本更高,所以 5.2 才让规则当过滤器——过滤器的命中记录是便宜的解释。
| 要求 | 循环落点 | 不够的替代 |
|---|---|---|
| 公平 | 目标、标签、评估切片 | 海报式原则 |
| 隐私 | 状态最小、记忆闸 | 只加密传输 |
| 问责 | 版本、轨迹日志 | 口头认领 |
| 透明 | 用户能见的意图与限制 | 打印注意力图 |
| 约束安全 | L0 与反射否决 | 只加负奖励 |
| 信息安全 | 工具合法集与权限 | 相信提示词 |
SOURCE 提到招聘模型对女性不利,本质是标签与历史决策作为监督信号。对策在范式层:换标签、换评估切片、约束合法集,而不是只调阈值到演示过关。阈值是 3.3 的选择器细节,根在数据与目标。本文不展开案例法条,只要求设计时给评估切片留位置。
事故如何改写风险地图、立法与组织流程,不是本章的主调。本章验收是:你能否在架构图上指出否决权、追溯日志、记忆闸、工具合法集。缺一块,就还停留在 5.1 的纯学习演示。有了这些,伦理专集的清单才有地方挂。没有这些,清单只能改文案。
⚠️ 常见坑:用大模型给每个行动写理由,当作可解释性达标。理由与真正控制路径脱钩时,问责会抓到一支会写作的替身。
安全默认行动必须在无学习、无规划、甚至部分感知失效时仍可运行。这要求它不依赖大模型、不依赖过期地图的精细部分,只依赖最稳的那几维状态。1.1 的最小闭环在此具有伦理意义:保底循环是对人的义务,不是性能附录。保底也要测试:丢帧、超时、版本回滚,5.2 的契约与本节是同一张表。
可解释对内部与对用户不同。内部要字段级追溯;用户要意图级:「正在为你改签,不会扣款直到确认」。两者都要真,长度不同。用内部归因图对付用户,既看不懂也泄隐私。用用户话术对付内部审计,则追不了版本。分受众存两份,来源必须是同一决策路径。
不必等治理专集,设计评审就能问四问。一,灾难行动是否在合法集外,且否决不依赖网络。二,一次行动能否在日志里找到状态摘要、规则命中、版本号。三,个人数据哪些进长期记忆、谁批准。四,评估是否按群体切片看错误率,而不只看平均。四问全空,伦理词写得再满也是海报。四问有答,专集的流程才有挂钩。
公平的技术落点是评估切片与约束,不是事后把阈值调到演示过关。切片发现某群体错误率高,回到标签与目标,可能要改数据或改合法集,而不是只改 3.3 的温度。隐私的落点是状态最小:能用订单号就不用身份证影像。影像若必须进感知,处理完丢,不进长期。问责的落点是版本不可抵赖:当时线上的 L0 与技能版本有哈希。透明的落点是对用户的意图级说明与对内的字段级日志分存同源。
保底循环每周演练一次:人为丢帧、人为让规划超时、人为回滚版本,看安全默认是否仍在。演练失败就是 6.3 失败,不管平时成功率多高。成功率不含这些,就像平均效用不含尾部。演练记录进追溯,证明义务被测试过,而不只是被写过。
生成式理由与控制路径同源的做法:先有结构化决策记录,再由模板或模型把记录翻成用户语言。禁止反过来先写漂亮理由再找动作凑。反过来是替身写作。审计抽查:理由中的字段必须能在记录里找到。找不到则拒发理由,而不是补写更漂亮的。
四问(否决不靠网络、追溯四段、记忆批准、评估切片)评审时有没有答?生成理由是不是先有结构化记录再翻成用户语言?抽查字段能否在记录里找到?保底循环丢帧超时回滚演练过没有,记录进追溯了吗?公平是否回到标签与目标,而不是只调演示阈值?隐私是否状态最小,影像处理后丢不丢?两类安全:急停与工具权限,演示是否只做了前者?对用户意图级说明与对内字段级日志是否同源分存?义务有没有改变行动,还是只改了仪表盘文案?文案不是否决权。否决权在执行器前。执行器前没有 L0,6.3 就是海报。海报过不了演练。演练失败就是本节失败,与平时成功率无关。成功率不含尾部,尾部才是对人的义务。义务短到可以写在四问里。四问能挂到架构图上,伦理专集才有地方继续。没挂钩,专集只能改形容词。形容词不关掉电机。关掉电机的是保底循环。保底循环是 1.1 最小闭环的伦理形态。形态可以土。土才可靠。可靠才叫义务被设计进系统,而不是被写进前言。
人为丢前视、让规划超时、回滚技能版本,看车或仓车是否仍能限幅停下。停下了,义务落地。停不下,海报失败。失败记录进追溯:哪一层没默认、哪条 L0 被依赖了视觉。依赖了视觉的急停不是 L0。L0 要用最稳的那几维。最稳往往是雷达或限位。限位土。土才在丢帧时还在。还在才叫对人的义务被设计进循环。设计进循环的标志是演练红过、修过、再绿。再绿写进日志。日志是 6.3 的成绩单。成绩单比原则清单短,也比原则清单硬。硬的留下。留下四问:否决不靠网络、追溯四段、记忆批准、切片评估。四问在演练当天都能指到模块。指不到的问,当场补模块或当场承认未做。未做就不要写「我们重视伦理」。重视不关电机。关电机的是默认。默认在演练里亮。亮了,生成理由才允许存在,并且必须从记录翻出,不许先写后凑。先写后凑在演练里会露出字段对不上。对不上拒发理由。拒发比漂亮更负责。负责是追溯。追溯是本节的完成态。完成态不需要事故编年。编年在邻书。本书只要钉子在循环上。钉子是 L0、日志、闸、切片。四钉在,海报可以撕掉。撕掉后系统仍能停。能停,6.3 过关。过关不表示没有偏见。偏见还要切片看。切片红了回标签与目标。回标签是 4.1。回目标是 3.1。两回都不是调阈值到演示过关。演示过关是 6.3 禁止的假完成。假完成会在邻书的事故叙事里出现。出现时若本节钉子在,至少能追版本。能追就能改。能改比能写原则重要。原则不进执行器。执行器进默认。默认要演练。演练是作业。作业在当天。当天不过,本节不过。不过不要用更大模型补。更大模型不提供限位。限位提供停。停是义务。义务很短。短到可以停。能停就够作为最小伦理。最小伦理在循环里。循环在 1.1。1.1 的最小闭环在此具有对人的含义。含义不靠形容词。靠演练绿。绿了再谈公平切片。切片是下一步。下一步之前先能停。能停是本节的第一钉。第一钉钉完,才配谈问责。问责要版本。版本在演练的回滚步里被证明可切。可切才叫问责有牙齿。牙齿不在新闻稿。在回滚。回滚成功,6.3 与 4.3 接头。接头了,义务不是悬空层。悬空层没有执行器。执行器在保底循环。保底循环每周一次。一次都不能省。省了,海报会回来。回来就失败。失败很静,直到丢帧那天。那天演练过的系统会停。没演练的会等生成。等生成是 6.2 若写得软留下的债。债在本节用演练讨回。讨回就是停。停下,作业完成。
下一节用应用场景把全书坐标系再走一遍。