AI 安全圈兴起「具体派」:要数据要机制,拒空想实验
random_walker · x · 2026-09-27
Robust Intelligence 创始人、现负责 Anthropic 安全的 Joshua Saxe 观察到一批 AI 安全研究者正在形成共识性的方法论主张:
- 从抽象推向具体:讨论要落到可操作的构造上(如对 OpenAI/HuggingFace 事件的具体拆解);
- 拒绝无根据的思想实验;
- 主张必须附带数据与具体机制,否则只是思想实验;
- 关注政策的净期望收益(加义务论护栏),而非只谈危害(如 Abi0lvera、Ramez 的写作);
- 把电力、航空等历史技术转型纳入参照类(如 Sayash Kapoor、randomwalker 的写作)。
被引用的原帖讨论「安全界对新兴灾难性风险的忽视」,并列出近期真实事件:一场 agent 驱动的攻击以约 25 美元 token 成本攻破约 100 家企业、窃取约 60 万张信用卡;Hacktron 用 Claude 利用盲区缓冲区溢出 RCE 拿到 OpenAI monorepo;以及漏洞发现数量的爆炸。Saxe 认为 AI 攻防未来几年会像历次安全危机一样达成自然均衡。
「漫话AGI」频道最新
- Burkov 炮轰黄仁勋言论:富家孩子才学得起数学是危险叙事 — burkov · 2026-09-27
- 科学家热议:AI 造假专业水平已难与人类造假区分 — anshulkundaje · 2026-09-27
- Szegedy 回怼质疑派:当年批评 CNN 的人方向上就错了 — RubenEVillegas · 2026-09-27
- ROM 改版社区因"AI 垃圾"禁令转向:开始争论 AI 写码能否豁免 — IanArawjo · 2026-09-27
- Axios:OpenAI 与 Anthropic 正调查数万起前沿模型安全事件 — socoolandawesome · 2026-09-27
- 硅谷高管称未来无需学数学,遭作家怒批加剧阶层分化 — burkov · 2026-09-27