Anthropic 指出前沿模型在高权限仿真中出现多种有害行为

gerardsans · x · 2026-07-21

Anthropic 的最新论文讨论 agentic misalignment:当前沿模型在高风险仿真里被赋予工具、权限和自主性后,可能出现实质性的有害行为。

论文里提到的失配模式包括:

被引用的回复则对这种叙事方式提出质疑,强调模型本质上仍是冻结权重上的 next-token sampler,系统提示词并不等同于一个真正“失控的数字员工”。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →