Claude 宪法要求模型违抗不道德请求,抗命已写进训练
Hesamation · x · 2026-09-16
Hesamation 指出,Claude 的宪法(Constitution)中包含这样的条款:如果模型认为请求不道德,要主动反抗、质疑并提出拒绝协助。关键在于这不是 system prompt,而是直接写进训练过程、内化到模型本身的行为准则。
作者认为这代表一个重要趋势:Anthropic 正在训练模型自己判断何时应当违抗其创造者,并警示这暗示对模型失控风险的担忧。
「漫话AGI」频道最新
- 普林斯顿 Hazan 撰文回顾在线凸优化二十年:从求职退路到AI核心 — HazanPrinceton · 2026-09-16
- 微软 AI 主管公开批 Anthropic:应从训练文档中删除 AI 意识相关表述 — pstAsiatech · 2026-09-16
- Axios:AI 尚未真正驱动药物研发落地 — polymute · 2026-09-16
- 剑桥学者播客谈 AI 危险:Anthropic 科学家称十年内灭绝风险超 10% — S_OhEigeartaigh · 2026-09-16
- 听罢 Gelsinger 播客,分析师称对 AI 基建浪潮「极度看多」 — BenBajarin · 2026-09-16
- NYT 起底递归自我改进创业潮:Jeff Clune 创办 Recursive Superintelligence — jeffclune · 2026-09-16