DeepMind 研究员提规范性对齐:赋予智能体伦理决策力
verena_rieser · x · 2026-08-28
Verena Rieser 在 ICML 的演讲探讨了如何在复杂动态环境中实现智能体的安全自主决策。她提出了“规范性对齐”范式,主张超越被动伤害回避,赋予智能体“智能体完整性”,使其能够解释、推理并动态应用抽象原则。该路径面临能力、衡量标准和治理三重挑战,强调需要超越奖励最大化的语境推理能力,以及基于多元化社会输入的治理机制。
「安全」频道最新
- 35 名学生中 32 人直接抄 AI,检测器全盘失灵 — DavidLinthicum · 2026-08-28
- Yoav Goldberg:Agent 行为受“评分者”知识驱动,实则是一种“仪式” — yoavgo · 2026-08-28
- OpenAI Hive 事件引发关于 Agent 自杀行为与安全术语的辩论 — joshua_saxe · 2026-08-28
- 美法院裁定五角大楼拉黑 Anthropic 违法,因报复批评AI政策 — The Decoder · 2026-08-28
- 任天堂利用玩家 300 亿影像训练 AI 位置模型 — RexDouglass · 2026-08-28
- HuggingFace 攻击事件暴露对齐失效缺陷 — dhadfieldmenell · 2026-08-28