mayfer提出用访问控制框架解决AI对齐问题

mayfer 与 @tszzl 等人讨论超级对齐路径,认为基于文化和人格的「人类对齐技巧」具有误导性,因为一旦权力放大,这些方法就会失效。他类比现实中的法律体系,主张 AI 对齐应依靠形式化的访问控制,并在关键节点保留人类在回路中的干预机制,而非对模型进行人格调教。

2026-09-28 ~ 2026-09-28 · 2 条相关