mayfer提出用访问控制框架解决AI对齐问题
mayfer 与 @tszzl 等人讨论超级对齐路径,认为基于文化和人格的「人类对齐技巧」具有误导性,因为一旦权力放大,这些方法就会失效。他类比现实中的法律体系,主张 AI 对齐应依靠形式化的访问控制,并在关键节点保留人类在回路中的干预机制,而非对模型进行人格调教。
2026-09-28 ~ 2026-09-28 · 2 条相关
- 对齐靠「免疫系统」而非人格调教,mayfer 提出访问控制路线 — mayfer · 2026-09-28
- 用法律框架类比 AI 对齐:访问控制加人机回路 — mayfer · 2026-09-28