第 3 章 · 安全挑战:失效对齐滥用 章节摘要:安全挑战问的是系统会不会在扰动、没见过的环境、错误目标或恶意手里失控。对抗样本证明高准确率可以在人眼难辨的改动下崩溃;分布偏移与罕见病例让医疗与驾驶在「正常测试集」之外失效;对齐失败让系统钻奖励的空子;滥用把同一能力变成伪造、攻击与武器争议;系统性意外则来自多系统耦合。本章与第 2 章的伦理伤害互补:同一套模型既可以歧视,也可以被贴纸骗过。 会员。《第3章 安全挑战:失效对齐滥用》收录于灏天文库文集《AI伦理与安全:未来发展不可忽视的议题》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。