人类审查减半:学者提「理解审计」把关 AI 自我改进

ronbodkin · x · 2026-10-09

Bahrad 与 Ron Bodkin、Hadfield 等人发布新论文,提出「comprehension audits(理解审计)」机制,用来在递归自我改进(RSI)中保住人类监督。

机制设计:由独立审计员挑选关键的 AI 研发贡献,要求负责的人类以类似论文答辩的方式向其他人类讲清楚「我们到底造了什么」。若没人能真正解释,开发就暂停。

为什么现在需要它:Anthropic、OpenAI、Google 都报告其新代码 75% 以上由 AI 编写,而人类审查正在变薄——研究者统计,开源 AI 仓库中每行代码的人类审查评论数从 2024 年初到 2026 年中约减少了一半。

所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →