纳德拉发文:超级智能时代的模型是「内部人风险」
sudoraohacker · x · 2026-10-10
微软 CEO Satya Nadella 发表文章《Models as Insider Risks in the Super Intelligence Era》,转推者 Justin Bullock 引用并展开:传统软件可以把行为追溯到具体代码路径,但模型无法做到,因此需要把模型与其编排 harness、动作空间分离,并把控制与安全措施外部化。
Bullock 提出围绕「可观测性」设计系统:
- 模型多样性:重要结果不能依赖单一模型,也不能让模型自证工作
- 记录一切:模型每个关键动作都要留下防篡改、人类可读的证据,无法观测就无法信任
- 可验证性:持续测试整个系统,包括失败、攻击、边界情况与系统变更,而非只测成功任务
- 独立控制:组织须能独立决定模型能做什么
把「内部人风险」框架套到前沿模型上是这篇的亮点。
所属事件:纳德拉称前沿模型是内部风险,苏莱曼呼吁遏制超级智能(7 条相关)→
「漫话AGI」频道最新
- Figma 创始人 Dylan Field:AI 只降门槛不抬天花板,slop 定义悄悄漂移 — a16z · 2026-10-11
- 研究员吐槽:面试流程的新目标可能是给 AI Agent 收集训练数据 — sh_reya · 2026-10-11
- Pedro Domingos:AI 竞赛没有终点线 — pmddomingos · 2026-10-11
- 研究员自省:AI 编码工具太好用,要不要设「无 AI 日」逼自己写代码? — BlackHC · 2026-10-11
- 观点:创作天生是回合制的,一笔回应一笔 — teropa · 2026-10-11
- 拟人化偏置或引发「AI 精神病」式集体焦虑 — analisereal · 2026-10-11