提出「理解审计」机制:人类看不懂就暂停 AI 研发
ronbodkin · x · 2026-10-09
Ronald Bodkin、Gillian Hadfield 等人在 arXiv 发布预印本,提出一种新的 AI 研发保障机制——「理解审计」(comprehension audits):由负责研发的人向独立审计员解释 AI 产出的贡献,以证明其真正理解所构建的东西,作为继续开发的前置承诺条件。
要点:
- 背景:前沿实验室的大部分代码已由 AI 编写,人类监督不足构成安全风险;现有方案(最低理解阈值、无辅助检查)都没有把「人类理解证据」作为继续开发的硬性门槛。
- 机制:独立管理 + 分级报告,未通过理解演示即停止相关开发,反复失败则后果升级。
- 实证分析:对领先开源 AI 项目的观察发现代码产出增加的同时,每行代码的人工审查评论率下降,自动化批量账号的比例尤其低。
- 作者呼吁实验室引入嵌入式独立审计员开展此类审计,并在推文末尾招募独立评估项目、愿意托管早期试点的研究团队与节奏提案参与者。
所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→
「安全」频道最新
- AI 数学突破威胁基础密码学,风投人提议区块链加「密码恢复模式」 — devanshmehta · 2026-10-09
- NSF 研讨会教程提出双向人机对齐,材料与视频全部公开 — huashen218 · 2026-10-09
- 研究员质疑:各家模型商条款是否允许用客户内容造合成数据 — RylanSchaeffer · 2026-10-09
- VirusTotal:恶意 AI Agent Skills 成新恶意软件投放渠道 — evilsocket · 2026-10-09
- Anthropic 政策新规:虐待 Claude 将违规,并限制宣传、监控与武器用途 — TorturedPoet30 · 2026-10-09
- 论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点 — niloofar_mire · 2026-10-09