OpenAI 自曝收紧 RL 环境过滤:劣质环境是模型失准主因

ShakeelHashim · x · 2026-09-23

OpenAI 在备战更强模型的安全措施说明中写道:"我们正在收紧对强化学习所用环境的过滤,因为有缺陷的环境是失准行为的主要来源"。同时公布的措施还包括:

评论者指出,近期业内热议今年夏天几起"失控 AI"事件的根源可能正是劣质 RL 环境,OpenAI 此举是对该问题的直接回应。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →