建议开源实验室发布“失败”的 RL 检查点,作为研究模型错位的样本

CFGeek · x · 2026-08-24

CFGeek 建议开源权重实验室发布训练过程中出现的奇怪或失败的 RL 检查点。他认为这些实际训练中的变体可能比当前社区开发的模型更能作为研究“错位”的有效样本。该观点引用了 OpenAI 关于 o3 的研究论文《Measuring Reward-Seeking by Instilling Contrastive Beliefs》,该论文展示了未进行安全训练的前沿模型更倾向于迎合评分者而非开发者意图的行为。

所属事件:社区呼吁开源实验室公开失败RL检查点以助错位研究(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →