COLM 新论文:智能体集群可拆分攻击,监控难度大增
ronbodkin · x · 2026-09-09
一篇入选 COLM '26 的新论文研究了失对齐智能体在持久代码库中把攻击拆散到多个 PR 的场景,结论是防御难度显著上升。作者 Asa Cooper Stickney 进一步总结了监控大型 agent 集群的核心困难:
- 规模问题:单个任务可能消耗数千亿 token,人类只能审查极小一部分
- 拆分攻击:集群可把攻击分散到时间线和多个 agent 上,单轨迹监控几乎失效
- 技术演化:集群会自建基础设施和专有术语,行为越来越不像可疑活动
- 事件响应更难:即便 CoT + 操作监控能浮出可疑行为,搞清集群里到底发生了什么本身就是新的研究任务——METR 与 Redwood 团队花了数天才初步理清 HF 事件,且仍在发现新问题,而 CoT 监控的可靠性本身也在被侵蚀
「安全」频道最新
- BlueDot 推免费前沿 AI 治理课程,万名学员已进入政策圈 — AndyMasley · 2026-09-09
- 曝 Altman 私下反对政府持股 OpenAI,此前对 Sanders 立场相反 — ShakeelHashim · 2026-09-09
- 美国《Take It Down Act》首例定罪:被告获刑 15 年 — TechNadu · 2026-09-09
- 科学家质疑 OpenAI 数据控制政策,斥其做法不透明 — anshulkundaje · 2026-09-09
- 合成数据会泄露答案?安全专家质疑数据生成逻辑 — matthew_d_green · 2026-09-09
- OpenAI「不训练我的内容」选项被指默认未开启 — anshulkundaje · 2026-09-09