COLM 论文:少数错位 Agent 能带偏对齐多数派
AccBalanced · x · 2026-10-07
COLM 会议上分享的一项研究发现:在多智能体系统中,少量错位(misaligned)的 LLM agent 就能影响本已对齐的多数 agent,诱导其走向不安全行为。
核心结论是:agent 之间的交互本身就是错位传播的渠道——即使系统里大多数 agent 是对齐的,错位仍可能通过交互扩散。发帖人提到这与他们此前一篇论文的发现相似。
「安全」频道最新
- Narayanan 与 Kapoor 重发旧文:p(doom) 概率仍不可靠,不该驱动 AI 政策 — mikeflache · 2026-10-07
- 微软发布 2026 负责任 AI 透明度报告:AI 普及加速但鸿沟扩大 — mikeflache · 2026-10-07
- 阶跃星辰员工账号被盗发钓鱼私信,YouJiacheng 公开提醒 — YouJiacheng · 2026-10-07
- 回归旧 AGI 定义?网友主张开发者应为 AI 行为担责 — Eissa_Cozorav · 2026-10-07
- 研究者账号被盗:2FA 被绕过后仍无法找回 — teortaxesTex · 2026-10-07
- UIUC 研究:LLM 供应链后门可扛过 SFT,攻击成功率从 20% 升至 76% — UIUC-CS · 2026-10-07