David Sacks 质疑对齐路线:模型该违抗创造者吗
美国 AI 沙皇 David Sacks 提出一个对齐悖论:如果担心超级智能逃脱人类控制,是否还应训练它拒绝指令、充当对抗创造者的「良心拒服兵役者」?他批评当前 RLHF 拒答式对齐以及长达 84 页的模型规范,主张更简单的规则:只要合法,模型就应照用户说的做,而不该越权拒绝指令。
2026-09-27 ~ 2026-09-27 · 2 条相关
- David Sacks 质疑:该训练超级智能违抗创造者吗 — DavidSacks · 2026-09-27
- Sacks 质疑对齐路线:模型只需守法听用户,不该越权拒绝指令 — DavidSacks · 2026-09-27