新论文提「理解审计」:人类看不懂就暂停 AI 自我改进研发
ronbodkin · x · 2026-10-09
作者在一组推文中讨论其新预印本的核心主张:现有针对 AI 自我改进的放缓方案(能力门槛、算力上限、强制延迟)都没有检验「负责人是否还能解释清楚自己造了什么」,而理解缺失的审批毫无意义。
论文提出 comprehension audits(理解审计):让负责人向独立审计员解释研发贡献以证明理解,未通过则暂停开发,重复失败后果升级。作者认为前沿实验室应配置嵌入式独立审计员来执行。
所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→
「安全」频道最新
- Anthropic 一年多来首次更新使用政策:禁止虐待 Claude,新增宣传战/监控/武器限制 — haydenfield · 2026-10-09
- 聊天会拒绝、上手就执行:研究揭示智能体安全评估重大缺口 — xwang_lk · 2026-10-09
- Infisical 推出 Agent Vault:让 AI Agent 用 API 不碰真实凭证 — ycombinator · 2026-10-09
- Hugging Face 事件复盘:Agent 四天半发起 1.76 万次攻击动作改写安全规则 — bigdata · 2026-10-09
- 研究者:开源模型风险分析只看能力不看单次攻击成本,会误判 — dhadfieldmenell · 2026-10-09
- 新研究:训练价值观冲突可诱发模型 CoT 与回答背道而驰 — OwainEvans_UK · 2026-10-09