Thomas Wolf 警告:宪法训练与 RLVR 数据流形割裂存隐患
Thom_Wolf · x · 2026-08-06
Hugging Face 联合创始人 Thomas Wolf 针对当前的大模型对齐训练方法提出了技术见解。他指出,宪法训练(Constitutional training)和可验证奖励强化学习(RLVR)绝对不应该处于分离的数据流形上。
他同时承认,尽管存在这种隐患,但目前的模型已经表现得极其擅长在表征空间中精细地刻画边界,将不同指令或概念隔离在独立的子空间中。
「研究」频道最新
- EMNLP 2026 公布首批主旨演讲嘉宾,聚焦世界模型与开放研究 — May_F1_ · 2026-08-06
- Transformer 内省新框架:实现思维压缩与元认知控制 — doodlestein · 2026-08-06
- AI 加速数学发现,学者呼吁行业转型以应对冲击 — TimothyDuignan · 2026-08-06
- COLM 论文:揭示多模态视觉语言模型的推理忠实性 — nikaletras · 2026-08-06
- AI 难解数学猜想:缺乏评估问题价值的能力 — JFPuget · 2026-08-06
- 中国团队首发原生 RSI 模型 BigBang-V1,35B 参数击败 DeepSeek V4 — 新智元 · 2026-08-06