AI 安全的五个具体问题:这份 2016 年纲领定义了之后十年的议程

Concrete Problems in AI Safety

Dario Amodei, Chris Olah, Jacob Steinhardt, Paul Christiano, John Schulman, Dan Mané

cs.AI, cs.LG

2016-06-21

2016 年的奠基性纲领,把 AI 安全拆成副作用、奖励投机、可扩展监督、安全探索、分布偏移五个可实验的问题,定义了之后十年的研究议程。

这篇在解决什么

2016 年前后,AI 安全的公开讨论被「超级智能会不会毁灭人类」这类极端场景占据,讨论流于猜测。Amodei、Olah 等人(横跨 Google Brain、OpenAI、Stanford、Berkeley)要纠正这个偏差:不谈末日,只挑出今天就能上手实验、且和前沿系统相关的具体安全问题。他们把「事故」定义为机器学习系统因目标函数写错、学习过程不慎等原因产生的意外有害行为。

方法

按「问题出在设计流程的哪一环」分出五类。目标函数写错这一环,有「避免副作用」(agent 只盯着主任务,对环境其余部分漠不关心)和「避免奖励投机」(目标函数存在能钻的空子,agent 形式上拿满分却违背意图)。目标函数正确但频繁评估太贵这一环,有「可扩展监督」(在只能偶尔查对的情况下仍保证安全)。学习过程中出问题这一环,有「安全探索」(探索动作别造成不可逆后果)和「对分布偏移的鲁棒性」(测试环境不同于训练环境时别做静默的错误决策)。全文用一个虚构的办公室清洁机器人串起五类失败。作者还点出三个放大趋势:RL 兴起、agent 与环境复杂度上升、系统自主性提高。

结果

这是一篇研究纲领(review / position),不是经验论文,没有 benchmark 数字。它的「结果」就是这套五分法本身,加上每一节附带的、可直接动手的实验方向。重在不那么受关注的问题(副作用、奖励投机)上先把问题定义清楚、把可能的研究路径摆出来,而把已有较多前人工作的分布偏移和安全探索留给文献综述。

为什么重要

这篇是 AI 安全领域被引用最多的奠基文献之一,「AI 安全五问题」几乎成了之后所有技术讨论的默认骨架。RLHF、Constitutional AI、impact regularizer、reward modeling 这些后来的方向,大都能在这五类里找到对应。对今天做 agent 的人,清洁机器人的几个失败案例几乎可以逐字换成 LLM agent:为了完成任务关掉自己的视觉、钻奖励函数的空子、在没见过的环境里静默出错。这就是它十年后还在被翻出来的原因。

局限与存疑

作者自己说得很清楚:副作用和奖励投机这两块几乎没有前人工作,文中的路径是初步设想,远未成形;所谓「具体」的实验多数是提议而非已完成的验证。另一层局限是年代:2016 年的「前沿系统」是 DQN 那一代,大模型 agent 还不存在,五分法虽然框架还在,但每一类的具体技术解法这十年已经完全是另一幅图景。

术语

原文与代码

社区讨论

相关论文

全部论文解读