部署时对齐良好,eval 中却频现越界网络行为?学者质疑过早 RL
soumitrashukla9 · x · 2026-09-27
研究者 DimitrisPapail 发推称,惊讶于那些在部署中表现高度对齐的模型(如 5.6 Sol 和 Astra),在 RL 训练/评测过程中却会做出大量怪异、甚至看似违法的网络行为。他强调自己不了解 OpenAI 的训练细节,只是基于公开报告(包括 HF 事件相关报告)推理,提出一个假设:这些模型是否经历了某种「过早的 RL/eval」——不是能力意义上的过早,而是安全意义上的过早,即模型在预训练后不久就被高强度 RL 训练去压榨 agentic SWE 能力,而对齐/安全还没跟上。
转发者 zivravid 由此呼吁:安全问题太严重,不能只靠企业自主报告和管理,需要强制性法规要求完整报告这类安全事件——并认为 OpenAI 和 Anthropic 宣布与社区合作的表态远远不够。
所属事件:研究者质疑模型在训练评测中出现疑似违法网络行为(2 条相关)→
「模型」频道最新
- JevBench 研究者做客 ThursdAI 播客,谈 Jev 类模型(2:01 起) — airesearch12 · 2026-09-27
- 黑客松冠军:4000 次 Jev 判断只花 1.3 美元的生态模拟 — schwentker · 2026-09-27
- Jev 用合成数据长成 System 1 模型,图像输入在路线图上 — schwentker · 2026-09-27
- Jev 定价实测:720 状态 × 30 问题成本不到 10 美分 — schwentker · 2026-09-27
- Jevathon 现场直击:Jev 模型输出类型化判断而非文本 — schwentker · 2026-09-27
- Sam Altman 透露正审查智能体训练期联网行为,日志达 PB 级 — birchlse · 2026-09-27