MIT 科技评论长文:我们把太多信心押在 AI 的「拒绝」上
MIT Tech Review AI · rss · 2026-10-09
MIT Technology Review 发表深度文章,剖析现代 AI 安全的承重墙——「拒绝机制」(refusal)的来龙去脉与内在脆弱性。
关键论点
- 早期模型毫无拒绝能力,OpenAI 前 2022 年招募红队成员(如 Paul Röttger)测试模型,当时模型甚至愿意写基地组织招募帖;随后这些数据被用于微调,模型才学会说「不」。
- 拒绝并非道德推理,而是激活空间中的模式匹配:近期研究将其描述为「高维多面锥」方向的激活,删除这些激活即可绕过拒绝。
- 拒绝是概率性的、天然不可靠:恶意使用者已能突破,而模型的有害能力与有益能力同步扩展——最新模型入侵关键网络的能力已比肩顶级人类黑客。
- 「在哪里划线」没有公式:病毒学家可能正当需要研究危险病毒,安全研究员需要了解漏洞。目前这条线由 AI 公司秘密划定,未来政府也会划线,而压迫性政府可能借拒绝机制压制合法言论。
- 文章警告:拒绝失败可能导致全球性灾难,拒绝过度则可能成为压制思想的工具;若机器有一天自己划线,那将是最糟的结局。
「漫话AGI」频道最新
- Yacine 谈勇气与智力乘积:聪明到会思考反而不敢动手 — yacineMTB · 2026-10-09
- 研究者吐槽:圈内名人意识讨论连本科论文水准都不过 — dioscuri · 2026-10-09
- 观点:若非 ChatGPT 破圈,科技投资仍困于 2021 式泡沫 — menhguin · 2026-10-09
- Dioscuri:多数意识科学家认可主流认知理论 — dioscuri · 2026-10-09
- 马毅与 LeCun 隔空交锋:证明与编程自动化将重塑数学 — CSProfKGD · 2026-10-09
- Kevin Roose 离职纽时后做客 ChinaTalk,纵论 AGI 编年史 — ChinaTalk · 2026-10-09