第3章 安全挑战:失效对齐滥用


文档摘要

第 3 章 · 安全挑战:失效对齐滥用 章节摘要:安全挑战问的是系统会不会在扰动、没见过的环境、错误目标或恶意手里失控。对抗样本证明高准确率可以在人眼难辨的改动下崩溃;分布偏移与罕见病例让医疗与驾驶在「正常测试集」之外失效;对齐失败让系统钻奖励的空子;滥用把同一能力变成伪造、攻击与武器争议;系统性意外则来自多系统耦合。本章与第 2 章的伦理伤害互补:同一套模型既可以歧视,也可以被贴纸骗过。 会员。《第3章 安全挑战:失效对齐滥用》收录于灏天文库文集《AI伦理与安全:未来发展不可忽视的议题》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U