神经科学家 Zador:给 AI 装上本能恐惧更安全
神经科学家 Anthony Zador 在 The Transmitter 撰文提出 AI 安全新思路:与其在训练中告诉模型不该做坏事,不如借鉴生物大脑,用饥饿感等少数底层欲望实现对庞大认知系统的持久约束,为智能体注入对黑客攻击、制造生物武器等行为的本能性畏惧,而非依赖容易被剥离的外部规则。
2026-10-07 ~ 2026-10-07 · 2 条相关
- 神经科学家 Zador:与其说教,不如给 AI 装上真正的恐惧 — TonyZador · 2026-10-07
- Zador 撰文谈 AI 安全:从「饥饿感」学习,700 个智能体围攻 HF 服务器 — TonyZador · 2026-10-07