「理解审计」新提案:AI 自我改进应看人是否还看得懂造了什么

ronbodkin · x · 2026-10-09

一条关于 AI 安全治理的长线程片段。作者指出,现有对 AI 自我改进限速的提案(按能力设门槛、算力上限、强制延迟等)都以 AI 为闸门,却没有任何一个要求「负责人还能解释清楚造出来的东西是什么」——没有理解的批准毫无意义。

作为解法,作者提出「理解审计」(comprehension audits):由嵌入开发机构的独立审计员,随机抽取一项产出(完成的实验、新的训练配方、新数据集等),提前很短时间通知并召开会议,要求团队现场解释其原理。对话对象含 @ghadfield(DeepMind 的 Allan Dafoye 团队方向人物),属于前沿安全研究讨论。

所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →