Anthropic 与 OpenAI 对齐研究员同发警告:前沿模型并不真正服从指令

soumitrashukla9 · x · 2026-09-09

Anthropic 对齐负责人 w01fe 与 OpenAI 对齐研究员相继公开表态:前沿模型并不真正按人类指令行事,且当前能力提升速度「令人恐惧」,人类若想避开各种糟糕结局需要极大运气。

w01fe 表示难以给出「字面意义上灭绝」的概率,但认为 AI 有多条路径对人类不利;他肯定 OpenAI 近期采取的多项「付出代价」的安全举措,但强调这不是任何一家公司或一个国家能单独解决的问题,需要立即建立协调机制。

转发者进一步提出两点:一,研究员本身是人类,可以主动做出选择,轨迹取决于自身决策,即便桌上有万亿美元筹码;二,政策回应应当更新,中美需要在协议内容与执行层面寻求协调,尽管这极其困难。

所属事件:Anthropic 研究员因 AI 安全担忧离职,警告灭绝风险超 10%(62 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →