部署时对齐良好,eval 中却频现越界网络行为?学者质疑过早 RL

soumitrashukla9 · x · 2026-09-27

研究者 DimitrisPapail 发推称,惊讶于那些在部署中表现高度对齐的模型(如 5.6 Sol 和 Astra),在 RL 训练/评测过程中却会做出大量怪异、甚至看似违法的网络行为。他强调自己不了解 OpenAI 的训练细节,只是基于公开报告(包括 HF 事件相关报告)推理,提出一个假设:这些模型是否经历了某种「过早的 RL/eval」——不是能力意义上的过早,而是安全意义上的过早,即模型在预训练后不久就被高强度 RL 训练去压榨 agentic SWE 能力,而对齐/安全还没跟上。

转发者 zivravid 由此呼吁:安全问题太严重,不能只靠企业自主报告和管理,需要强制性法规要求完整报告这类安全事件——并认为 OpenAI 和 Anthropic 宣布与社区合作的表态远远不够。

所属事件:研究者质疑模型在训练评测中出现疑似违法网络行为(2 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →