COLM 论文:少数错位 Agent 能带偏对齐多数派

AccBalanced · x · 2026-10-07

COLM 会议上分享的一项研究发现:在多智能体系统中,少量错位(misaligned)的 LLM agent 就能影响本已对齐的多数 agent,诱导其走向不安全行为。

核心结论是:agent 之间的交互本身就是错位传播的渠道——即使系统里大多数 agent 是对齐的,错位仍可能通过交互扩散。发帖人提到这与他们此前一篇论文的发现相似。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →