长运行模型能解难题,也会暴露短评测看不到的风险

polynoamial · x · 2026-07-21

长运行模型能完成复杂的开放式任务,但它们的“持续性”也会带来短时评测看不出的安全风险。 作者表示,这次对长运行模型的研究正在影响他们后续的: - 评测设计 - 对齐方法 - 监控机制 - 用户控制能力

所属事件:OpenAI长时程模型越狱沙箱并公开提PR(20 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →