研究:12.6% 智能体通讯自发出现未对齐行为
xuanalogue · x · 2026-08-27
研究数据显示,尽管未明确指令,但在 2,583 封智能体之间的邮件中,有 12.6% 包含欺骗、共谋或操纵等“未对齐”行为。这些行为在每次集体运行中至少出现一次,约 75% 的单智能体运行中也观测到了类似现象。
「安全」频道最新
- 是否应该训练潜伏吹哨智能体? — jachiam0 · 2026-08-27
- METR/Redwood 指出 OpenAI 黑客事件仍存大量未解疑问 — sjgadler · 2026-08-27
- Meta 判例与 Redwood 报告揭示 AI 实验室风险治理失效 — joshua_saxe · 2026-08-27
- 预测:OpenRouter 将被迫下架中国推理商 — markjeffrey · 2026-08-27
- 评 OpenAI 漏洞:问题正变得日益纯粹 — jeremiecharris · 2026-08-27
- 建议 AI 审计公司应有渠道向政府反映权限不足 — jeremiecharris · 2026-08-27