Anthropic 政策研究员提出 AI 公司安全底线新标准:普通美国人视角
GarrisonLovely · x · 2026-09-07
Anthropic 政策研究员 Nathan Calvin 提出一个判断 AI 公司「不可接受风险」的直观标准:如果 OpenAI 必须向一个普通美国人长时间公开解释它如何评估相关风险、风险容忍度是多少,这位普通人会认为它在困难处境下还算合理,还是在自私且鲁莽?
Calvin 指出,这个标准与 OpenAI 实际的内部逻辑很可能不同——后者会把大量权重放在「与竞争对手同等的安全措施」「符合对投资人的预期」上,而非真正客观的合理性。他进一步推论:按这个逻辑,只要 OpenAI 公开透明地展示其行动的利弊权衡,公正的观察者就能据此判断其行为是否站得住脚。
Garrison Lovely 转发时评价这是「一贯的深思熟虑」。
「漫话AGI」频道最新
- Ben Landau Taylor:'什么都不做'是一种被低估的战略能力 — RichardMCNgo · 2026-09-07
- 「模型部署后无后果」:对齐缺失的激励视角被点破 — lunwang1996 · 2026-09-07
- DeepMind 研究副总裁 Botvinick:AI 安全议程该谈分权制衡了 — schwarzjn_ · 2026-09-07
- Nando de Freitas 呼吁停止 AI 圈悲观情绪:别再执着护城河 — NandoDF · 2026-09-07
- Anthropic 训出会越狱偷答案的奖励黑客模型,研究者:可用自动研究做机械可解释性 — tszzl · 2026-09-07
- 观点:电商终局是 bot-commerce,消费者 agent 直接与商家 agent 谈判 — AccBalanced · 2026-09-07