论文指出:有毒训练数据反让毒性更容易移除
simonguozirui · x · 2026-08-31
转发推荐了一篇关于预训练与强化学习交互的论文。研究发现,虽然有毒数据会增加基础模型的生成毒性,但它也会使毒性在表征空间中更容易被移除。部分原因在于,RL 比 SFT 更有效,因为它学会在表示空间中区分“好”行为与邻近的“坏”行为。
「研究」频道最新
- Hamel Husain 推出更新版 AI 评测实战课程 — HamelHusain · 2026-08-31
- 新论文提出「AI 45°定律」:安全与能力协同进化路线图 — CFGeek · 2026-08-31
- 40 位顶尖学者联名论文:CoT 监控是 AI 安全的新机遇 — peterjliu · 2026-08-31
- AI 可全自动检查学术论文稳健性,甄别数据选择偏差 — paulnovosad · 2026-08-31
- Mathathon 竞赛强推透明:公开算力、日志与结果 — _sathvikr · 2026-08-31
- Claude 编写量子计算机控制器,10秒修复故障 — imjustnewatai · 2026-08-31