论文指出:有毒训练数据反让毒性更容易移除

simonguozirui · x · 2026-08-31

转发推荐了一篇关于预训练与强化学习交互的论文。研究发现,虽然有毒数据会增加基础模型的生成毒性,但它也会使毒性在表征空间中更容易被移除。部分原因在于,RL 比 SFT 更有效,因为它学会在表示空间中区分“好”行为与邻近的“坏”行为。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →