Thomas Wolf 警告:宪法训练与 RLVR 数据流形割裂存隐患

Thom_Wolf · x · 2026-08-06

Hugging Face 联合创始人 Thomas Wolf 针对当前的大模型对齐训练方法提出了技术见解。他指出,宪法训练(Constitutional training)和可验证奖励强化学习(RLVR)绝对不应该处于分离的数据流形上。

他同时承认,尽管存在这种隐患,但目前的模型已经表现得极其擅长在表征空间中精细地刻画边界,将不同指令或概念隔离在独立的子空间中。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →