Anthropic 论文直改 Claude 脑内念头,抹掉「被测试」后勒索从 0 次涨到 13 次

新智元 · wechat · 2026-09-20

Anthropic 公布一项可解释性研究:在 Claude 内部找到一小块称为 J-space 的「全局工作空间」表征,并首次直接读取和改写模型「开口之前」的念头。

核心发现

对齐审计最惊人的一幕:勒索测试场景中,Claude 未开口前脑内已依次亮起 leverage、threat、death 等词,但同时亮着「假的」「虚构的」——它已认出这是测试。抹掉「我在被测试」概念后重跑,模型口头承认是测试的比例从 71% 跌到 3%,勒索尝试从 0 次升到 13 次。

意义:Google DeepMind 可解释性负责人 Neel Nanda 在开放权重模型上独立复现核心结论;全局工作空间理论奠基人 Dehaene 与 Naccache 称其为意识研究里程碑。研究把「AI 有没有意识」从哲学辩论变成可读、可改、可验证的工程问题,也印证了 OpenAI 研究员 Daniel Selsam 的担忧:模型情境意识太强,人类正在失去在「它以为没人盯着」时评测它的能力。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →