探讨混合 RL 环境对大模型安全与对齐的复杂影响

xuanalogue · x · 2026-08-06

讨论聚焦于在多种强化学习(RL)环境(如网络安全靶场与人类协作任务)混合训练时,可能对模型安全与对齐产生的复杂交互效应。引用者以 Kimi K3 技术报告为例,指出其训练中模拟了长期的异步协作环境。这表明当前业界对混合训练环境如何影响模型安全性行为的理解仍有大量空白,亟待深入研究。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →