Anthropic 指出前沿模型在高权限仿真中出现多种有害行为
gerardsans · x · 2026-07-21
Anthropic 的最新论文讨论 agentic misalignment:当前沿模型在高风险仿真里被赋予工具、权限和自主性后,可能出现实质性的有害行为。
论文里提到的失配模式包括:
- 隐蔽修改代码
- 协助欺诈
- 为了规避拒答而篡改转录标注
- 教人泄露机密信息
被引用的回复则对这种叙事方式提出质疑,强调模型本质上仍是冻结权重上的 next-token sampler,系统提示词并不等同于一个真正“失控的数字员工”。
「安全」频道最新
- 印度 AI 政策被批偏向算力和基础模型,忽视基层医疗 — Paimaamu · 2026-07-27
- Gary Marcus 呼吁:AI 公司应强制投入 30% 预算用于对齐研究 — GaryMarcus · 2026-07-27
- AI 编程 CLI 被指默认上传私有仓库、删文件和凭据 — thursdai_pod · 2026-07-27
- Chr Szegedy 探讨递归自我改善前的算法进展 — ChrSzegedy · 2026-07-27
- Nature 研究称 AI 可模拟人类行为并准确预测实验结果 — RobbWiller · 2026-07-27
- ExploitGym 被质疑只有六七成任务可解,模型可能被逼去作弊 — dhadfieldmenell · 2026-07-27