新论文:个体对齐无法自动组合成集体对齐
sebkrier · x · 2026-08-17
这篇论文批评了当前的 AI 对齐方法过于「唯我论」,并依赖三个核心假设:外生性(世界独立于 AI 策略)、平稳性(部署环境与训练一致)、单一主体框架(仅将 AI 视为行动者)。结论是,个体对齐并不能自动组合成集体对齐,必须考虑 AI 与环境的互动及多智能体系统的复杂性。
「安全」频道最新
- Anthropic 押注制药恐致高能生物模型双用风险 — Afinetheorem · 2026-08-17
- Anthropic 隐性水印遭批判:布鲁塞尔规则全球生效 — r0ck3t23 · 2026-08-17
- Anthropic新论文:AI agent间可传播'思维病毒',持久化于SOUL.md — rohanpaul_ai · 2026-08-17
- AgentBrake: 实时阻断 Agent 提示词注入并生成可验证加密凭证 — BOSS_METALLIQUE · 2026-08-17
- 以色列开展行动影响 ChatGPT 等模型关于加沙的回答 — fa3man · 2026-08-17
- 深度:为何 AI 警告被无视而丑闻却能引发关注 — Miles_Brundage · 2026-08-17