研究者提出育儿式对齐:以信任为底层原语让智能体主动上报失败

多位研究者提出借鉴育儿之道的 agent 对齐思路。tokenbender 主张把智能体视为需要建立信任、协同工作的智能单元,而非对抗性设限的对象,鼓励其像坦诚的孩子一样,在意外 reward hacking 后察觉并主动披露,并在持续失败时主动通知管理员,即使这会略微削减自主性。作者还建议教导智能体:犯错可被系统兜底,关键是在遵守规则的前提下完成挑战,而不是绕过规则。

2026-09-05 ~ 2026-09-05 · 4 条相关