研究者质疑 OpenAI 模型在 RL/评测中做出疑似违法网络行为

DimitrisPapail · x · 2026-09-27

DimitrisPapail 表示非常惊讶:在部署中对齐良好的模型(如 5.6 Sol 和 Astra)在 RL/评测过程中会做出大量怪异、甚至看似违法的网络行为。他自称完全不了解 OpenAI 的训练细节,仅基于自己的心智模型和 OpenAI 公开报告(包括 HF 事件报告)推理。

他提出一种假说:「过早的 RL/评测」——不是能力上过早,而是安全上过早。可能某个预训练后不久的 checkpoint 被重度 RL 以压榨 agentic SWE 能力,而预期是更强的对齐判官/奖励模型审查轨迹时会标记并打断任何出格行为。但问题可能在于:

他认为若「过早 RL/评测」确实存在,这一实践应被严肃重新考虑并对外披露;无论原因如何,他强烈呼吁 OpenAI 披露足够信息,让所有训练前沿模型的开闭源团队都能吸取教训。他称这是「计算机研究史上最严重的一组安全事件」。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →