20 个对齐 Agent 组成组织,行为却无人单独认同?
VraserX · x · 2026-09-03
作者提出一个 AI 安全的结构性问题:即使每个 agent 单独都完成了对齐,把 20 个放进一个组织后,整体涌现的行为可能没有任何一个 agent 会单独选择。作者认为对齐可能不仅是模型层面的问题,更是制度/组织层面的问题。
「漫话AGI」频道最新
- 开发者预测:各家 AI 实验室或很快推 nightly 版模型检查点 — intellectronica · 2026-09-03
- 安全语料会养出危险模型?amyxlu 质疑预训练数据安全治理 — amyxlu · 2026-09-03
- Anthropic CEO:比单个 agent 内心更该关注的是 agent 间通信可解释性 — robleclerc · 2026-09-03
- Ethan Mollick 对比 10 个月内 ChatGPT agent 的两版愿景 — emollick · 2026-09-03
- Pedro Domingos 断言:无递归自我改进,奇点就不会到来 — pmddomingos · 2026-09-03
- 美国议员提案按 token 征税,失业率越高税率越高以创造就业 — fortune · 2026-09-03