新论文提「理解审计」:人类看不懂就暂停 AI 自我改进研发

ronbodkin · x · 2026-10-09

作者在一组推文中讨论其新预印本的核心主张:现有针对 AI 自我改进的放缓方案(能力门槛、算力上限、强制延迟)都没有检验「负责人是否还能解释清楚自己造了什么」,而理解缺失的审批毫无意义。

论文提出 comprehension audits(理解审计):让负责人向独立审计员解释研发贡献以证明理解,未通过则暂停开发,重复失败后果升级。作者认为前沿实验室应配置嵌入式独立审计员来执行。

所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →