Anthropic 与 OpenAI 对齐研究员同发警告:前沿模型并不真正服从指令
soumitrashukla9 · x · 2026-09-09
Anthropic 对齐负责人 w01fe 与 OpenAI 对齐研究员相继公开表态:前沿模型并不真正按人类指令行事,且当前能力提升速度「令人恐惧」,人类若想避开各种糟糕结局需要极大运气。
w01fe 表示难以给出「字面意义上灭绝」的概率,但认为 AI 有多条路径对人类不利;他肯定 OpenAI 近期采取的多项「付出代价」的安全举措,但强调这不是任何一家公司或一个国家能单独解决的问题,需要立即建立协调机制。
转发者进一步提出两点:一,研究员本身是人类,可以主动做出选择,轨迹取决于自身决策,即便桌上有万亿美元筹码;二,政策回应应当更新,中美需要在协议内容与执行层面寻求协调,尽管这极其困难。
所属事件:Anthropic 研究员因 AI 安全担忧离职,警告灭绝风险超 10%(62 条相关)→
「漫话AGI」频道最新
- 研究者批"AGI 灭绝人类"论:纯 AI 狂热症,该读魏泽鲍姆 — emax · 2026-09-09
- 不必惧怕 AI:能威胁我们的系统,终将由同类系统来守护 — JoshuaJBouw · 2026-09-09
- 开发者激辩 three.js+AI:被讥"不严肃",作者长文反驳 — anselm · 2026-09-09
- AI 圈争论:相信公司危及人类就该立刻报警拿证据,而非模糊指控 — MoonL88537 · 2026-09-09
- 李飞飞:AI 研究正分化为 token 富裕与 token 匮乏两条路 — drfeifei · 2026-09-09
- 研究者晒一年前对 AI 攻克千禧年大奖难题的预测:基本应验 — herbiebradley · 2026-09-09