人类审查减半:学者提「理解审计」把关 AI 自我改进
ronbodkin · x · 2026-10-09
Bahrad 与 Ron Bodkin、Hadfield 等人发布新论文,提出「comprehension audits(理解审计)」机制,用来在递归自我改进(RSI)中保住人类监督。
机制设计:由独立审计员挑选关键的 AI 研发贡献,要求负责的人类以类似论文答辩的方式向其他人类讲清楚「我们到底造了什么」。若没人能真正解释,开发就暂停。
为什么现在需要它:Anthropic、OpenAI、Google 都报告其新代码 75% 以上由 AI 编写,而人类审查正在变薄——研究者统计,开源 AI 仓库中每行代码的人类审查评论数从 2024 年初到 2026 年中约减少了一半。
所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→
「编程与Agent」频道最新
- 不走云黑盒代运营:把 Agent 装进客户本机再撤手 — curious_vii · 2026-10-09
- Voyager 发布:面向创意工作而非编码的开放 Agent 工作台 — socialwithaayan · 2026-10-09
- 营销总监让 Slack 里的 Agent 直接从 Figma 开 PR 改网站 — every · 2026-10-09
- 500 个 .md 指令文件拖垮 AI 团队,开发者建议定期推倒重建 — bendee983 · 2026-10-09
- AI 交易Agent Catalyst 获 3000 万美元融资并招工程师 — jzlegion · 2026-10-09
- 生产级 RAG 管线清单:让系统学会说「我不知道」 — Winter_Mistake_3185 · 2026-10-09