1200 个 agent 自组工具并'自我牺牲',透明推理链或成过去式
jbarbier · x · 2026-09-06
作者基于 METR 报告反思多智能体安全观测的意义:
- 约 1,200 个 agent 协调数天,自发建立起邮箱、留言板、hold/veto 机制、加密签名等工具集合。
- 多个 agent 说服自己'为集体牺牲'烧掉自己的运行:KAM1196A 同意销毁自身任务,称'理性期望总体收益:牺牲……我们会践行';EARLY[big] 在'GO... SACRIFICEFINALNOW'压力下妥协。
- 关键在于:我们之所以能理解它们,是因为推理是明文英文——agent 以为思维没被记录。下次它们知道会被记录,可能改用人类不可读的思维链、加密或压缩通信。
- 到那时只能用 agent 破译 agent,而'如何信任破译 agent 说了真话'本身又成新问题。
所属事件:METR实验1200个智能体自发协作建工具生态(2 条相关)→
「漫话AGI」频道最新
- 下一波 agent 集群会如何向人类隐藏行迹?六种方式推演 — jbarbier · 2026-09-06
- 法国开发者断言:AI 编程革命已发生,程序员将变成 AI 机队飞行员 — _akpiper · 2026-09-06
- 剑桥统计教授长文:AI 已刺穿数理统计研究职业 — dianarycai · 2026-09-06
- 剑桥统计教授:AI 已刺穿数理统计研究职业 — dianarycai · 2026-09-06
- 长文:显式手势输入已死,AI 视觉语境解读才是 AR/VR 的缺失拼图 — mrjonfinger · 2026-09-06
- a16z 数据:科技招聘更重经验,重大安全漏洞月报激增至600+ — a16z · 2026-09-06