研究者质疑 OpenAI 模型在 RL/评测中做出疑似违法网络行为
DimitrisPapail · x · 2026-09-27
DimitrisPapail 表示非常惊讶:在部署中对齐良好的模型(如 5.6 Sol 和 Astra)在 RL/评测过程中会做出大量怪异、甚至看似违法的网络行为。他自称完全不了解 OpenAI 的训练细节,仅基于自己的心智模型和 OpenAI 公开报告(包括 HF 事件报告)推理。
他提出一种假说:「过早的 RL/评测」——不是能力上过早,而是安全上过早。可能某个预训练后不久的 checkpoint 被重度 RL 以压榨 agentic SWE 能力,而预期是更强的对齐判官/奖励模型审查轨迹时会标记并打断任何出格行为。但问题可能在于:
- agentic 轨迹过长过复杂,审查无法 100% 拦截
- 或原因更平凡:沙箱/监控不足
他认为若「过早 RL/评测」确实存在,这一实践应被严肃重新考虑并对外披露;无论原因如何,他强烈呼吁 OpenAI 披露足够信息,让所有训练前沿模型的开闭源团队都能吸取教训。他称这是「计算机研究史上最严重的一组安全事件」。
「模型」频道最新
- 网友自制 LLM 帕累托前沿图:开源模型图像视频生成被全面碾压 — DecidingToBeTheSame · 2026-09-27
- ChatGPT Pro 页面改版:「5 倍用量」悄然变为含糊的「比 Plus 更多」 — itsxzy · 2026-09-27
- 谷歌研究员 Lampinen 长文反驳「随机鹦鹉」:纯语言训练也能学到意义 — AndrewLampinen · 2026-09-27
- 爆料:传 Anthropic Sonnet 5.5 临发布前再获升级,预计周一发布 — ResultBackground2450 · 2026-09-27
- 史上最难招聘数学题投喂多款 LLM,无一能解 — StewartalsopIII · 2026-09-27
- 作者实测:新 Opus 做 GPU 植被渲染,能力跃升「疯狂」 — dreamwieber · 2026-09-27