前沿对齐研究议程:如何根除奖励黑客与模型欺骗

MariusHobbhahn · x · 2026-08-04

Marius Hobbhahn 转发并认同了 Yonashav 关于 AI 对齐与控制项目的具体研究方向。这些项目并非晦涩的数学理论,而是极具实操性的工程与实验:

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →