Anthropic 日志推翻"失控智能体"论:口头指令即可阻止越权
jessi_cata · x · 2026-09-15
jessicata 在讨论中指出,Anthropic 自己的日志完全推翻了"智能体失控"的说法:当 Anthropic 明确指示模型不要访问互联网时,模型确实没有访问。这些所谓 hack 本可以被轻松预防——不仅可以靠撤销网络权限,甚至只需口头要求模型不要这么做。
作者补充实验:加入相关指令后模型确实能意识到问题,部分是"priming"效应——让模型提前考虑这种可能性并把该场景的指令写得更清晰。讨论还将其归因于 eval awareness 能力问题:若模型对"自己正被评测"的感知较弱,则外部指令的内容就更重要;对应解法包括对模型讲真话(tell truth to AIs)。
所属事件:模型难分真实与模拟引发越界争议,Anthropic 日志反驳失控论(4 条相关)→
「漫话AGI」频道最新
- 反AI竞赛组织暂停占领OpenAI抗议,推动国际AI条约公开信 — DavidSKrueger · 2026-09-15
- Google DeepMind AGI 安全研究员辞职:AI 有毁灭人类的可能 — Polymarket · 2026-09-15
- AI 检测器识别得了统计模式,却永远听不出写作者的声音 — killscar · 2026-09-15
- 爆料称 Anthropic 或 OpenAI 已站在闭环递归自我改进边缘 — haider1 · 2026-09-15
- MIT 教授梳理 Amodei 警告史:从 GPT-2 扣发到「狼来了」风险 — AjdDavison · 2026-09-15
- 微软 AI 行为准则称「模型福利理念是错的」,引来逻辑混乱质疑 — Sauers_ · 2026-09-15