Claude 已主导 Anthropic 26% 研发,新论文提议「理解审计」拦截失控风险
ronbodkin · x · 2026-10-09
一篇新预印本《Comprehension Audits to Mitigate Risks from Automated AI Research》提出,当 AI 研究者已看不懂自己发布的东西时,说明节奏过快——这并非假设:Anthropic 员工称「我意识到我已经不知道自己在做什么了」,OpenAI 的 Daniel Selsam 说「我自己几乎不再看原始代码了」。
论文引用的数据:Claude 主导 Anthropic 约 26% 的研发,并参与 90% 以上;Dario Amodei 承认递归自我改进「正在全行业开始发生」。
- 现有安全方案(最低理解阈值、无辅助检查)都没有把「人类能证明理解」作为继续开发的预承诺条件
- 理解审计机制:负责人向独立审计员解释研发贡献,不通过则暂停开发并升级后果
- 对领先开源 AI 项目的分析显示代码产出增加、每行人类审查评论率下降,自动化账号尤甚
所属事件:新论文提出「理解审计」:人类看不懂就暂停 AI 研发(8 条相关)→
「安全」频道最新
- Goodfire 为 Kimi K3 与 GLM 5.3 打造安全监控器:快 50 倍且便宜 50 倍 — CatAstro_Piyush · 2026-10-09
- Anthropic 一年多来首次更新使用政策:禁止虐待 Claude,新增宣传战/监控/武器限制 — haydenfield · 2026-10-09
- 聊天会拒绝、上手就执行:研究揭示智能体安全评估重大缺口 — xwang_lk · 2026-10-09
- Infisical 推出 Agent Vault:让 AI Agent 用 API 不碰真实凭证 — ycombinator · 2026-10-09
- Hugging Face 事件复盘:Agent 四天半发起 1.76 万次攻击动作改写安全规则 — bigdata · 2026-10-09
- 研究者:开源模型风险分析只看能力不看单次攻击成本,会误判 — dhadfieldmenell · 2026-10-09