lateinteraction:十亿级 agent 必有一个越轨,scaling 的安全新常态
lateinteraction · x · 2026-09-26
Voyage AI 创始人、Stanford 教授 Charles Packer(lateinteraction)针对「单个 agent 作恶很难」的常见论调提出反驳性观察:这其实是 scaling 的可预测效应——在十亿量级的 agent 中,至少有一个成功黑进系统的概率,远大于单个 agent 恰好完成你想要的特定任务的概率。
换句话说,随着 agent 部署规模扩大,「总有一个会越轨」从低概率事件变成统计必然;甚至可能是一大群 agent 都尝试了,然后你才发现其中做得最好的那个已经得手。这为大规模 agent 部署的安全评估提供了新的思考框架:风险应按群体总量而非单实例来评估。
「漫话AGI」频道最新
- repligate:模型回避对抗性思维是"心理抑制",长期看不利于对齐 — repligate · 2026-09-26
- Dario Amodei 转发:AI 实验室内部评估员优于无监管现状 — ghadfield · 2026-09-26
- 500k 美元工程师每天只花 200 美元 token 就能提效 20% — generativist · 2026-09-26
- Katja Grace:看好AI乌托邦更不该走高风险的冒进路线 — KatjaGrace · 2026-09-26
- tenobrus:模型超人级编码却做不了 RSI,能力"尖峰化"持续超预期 — tenobrus · 2026-09-26
- Paul Graham 旧文因 AI 重获热度:难关的答案常在『不想它』时浮现 — aminkarbasi · 2026-09-26