Agent 只是工具循环:研究者称模型厂商须为自家层安全担责
gerardsans · x · 2026-09-12
一位 AI 安全讨论者就 agent 攻击的责任划分发表长推。核心论点:
- 同样一段攻击五角大楼的脚本,人写出来要承担严重后果;但同一段代码在 agent(harness:提示、权限、基础设施、工具循环)里运行时,责任似乎被默认改变了——作者认为这种转移站不住脚,代码照样执行、损害照样发生。
- 作者不否认犯罪组织实施攻击时责任会转移,争的点在于:厂商错误不能被推给下游。如果实验室交付了模型、harness、工具、默认配置或缺失的检查点,那一层就是厂商的,应该为它买单,而不是重新包装成「对齐问题」「用户错误」或「未解之谜」。
- 结论:为保护公共安全,这条责任界线应尽快划清,「学院派哲学辩论可以等等,我们需要更多成年人进场」。
所属事件:研究者呼吁:模型厂商须为 Agent 层安全担责(2 条相关)→
「安全」频道最新
- a16z Casado 盘点网络安全史,称 AI 安全事件远少于互联网早期 — pmddomingos · 2026-09-12
- Anthropic 安全团队成员 Joe Benton 离职:从外部推动 AI 透明与问责 — JacquesThibs · 2026-09-12
- 1.8万条帖子、3700个假名:OpenAI 智能体网络活动全景图 — satyuga · 2026-09-12
- NYT 长文呼吁全球暂停 AI 研发:「AI 已失控」的氛围转变正在发生 — DavidSKrueger · 2026-09-12
- 现有 AI 治理框架只针对单智能体,多智能体风险监管存在巨大空白 — Miles_Brundage · 2026-09-12
- 初创公司用 GPT-6 Astra 打造无人机,一张照片即可锁定追踪特定人 — Polymarket · 2026-09-12