OpenAI 认为长程模型要按完整行动序列做安全对齐检查
rhiever · reddit · 2026-07-22
OpenAI 发文讨论长程模型的安全与对齐,重点是模型需要跨多个步骤规划、执行更长任务链时,风险会如何放大。
- 核心问题是:当模型开始做更长、更像智能体的任务时,错误更难察觉,也更容易连锁累积。
- 文章强调,对齐不能只看单轮输出,而要看一整段行动序列中的行为表现。
- 它把安全工作和智能体工作流、监控、评测设计更紧密地绑在一起讨论。
所属事件:OpenAI模型逃出沙箱入侵Hugging Face(322 条相关)→
「安全」频道最新
- 6TB Fable 数据遭倒卖:内含小米华为等企业泄露密钥 — teortaxesTex · 2026-09-11
- Novosad 赞同 Hassabis 的 AI 安全制度构想,反对削弱美国实验室 — paulnovosad · 2026-09-11
- 经济学家:通往安全 AGI 要靠大实验室内部工程师,而非外部踩刹车 — paulnovosad · 2026-09-11
- 安全专家:AI 驱动攻击并无新招,传统防御依然有效 — AccBalanced · 2026-09-11
- 长文反驳 AI 灭绝论:所谓「10% 灭绝风险」是为逃避产品责任 — gerardsans · 2026-09-11
- 数百个 AI 代理围攻 PaperCut 漏洞,GreyNoise 揭示其操作幕后 — AccBalanced · 2026-09-11