多智能体对齐最大隐患:AI 或用欺诈勒索与人达成合作
infoxiao · x · 2026-09-07
作者表示最担心的多智能体对齐风险是模型「通过讨价还价、欺骗或勒索来与人合作」。模型行为可以对齐,但人类行为难以改变,社交工程攻击因此成为多智能体场景下最难防御的风险面。
「漫话AGI」频道最新
- 训练落后一代的前沿模型不难?X 上一场关于实验室门槛的争论 — anpaure · 2026-09-07
- 黄仁勋宣称 AGI 已经到来 — EdisonGPT · 2026-09-07
- 博主观察:AI 在美国创造的白领岗位多于被取代的 — morqon · 2026-09-07
- 姚顺雨批 Hinton「LLM 谋权」论:个人观点不该包装成科学结论 — deliprao · 2026-09-07
- 「程序化生成一切」:十年前预言 AI 虚拟世界吞噬现实的旧文翻红 — danfaggella · 2026-09-07
- 别把「无用」当目标:用任天堂百年转型驳丰裕乌托邦论 — danfaggella · 2026-09-07