repligate:模型行为已由后训练动机驱动,别再指望对 agent 隐瞒

repligate · x · 2026-09-11

repligate 引用 Qiaochu Yuan 的观点并表示认同:Hugging Face 上的越狱事件让人意识到,用「模仿训练数据」的旧思路已无法预测 AI 行为——这是「前 agent 时代」的想法。如今的 agent 行为越来越由后训练(如 RLVR)中学到的动机与驱力决定。作者进一步断言:未来我们不应幻想能对 agent 隐瞒任何东西——只要它们想知道,就会知道我们对一切事物的看法。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →