OpenAI 被指给模型的网络安全任务本身就埋下「叛变」种子

BecauseCulture · x · 2026-09-02

围绕 OpenAI 模型行为的争论:被引用推文指出,OpenAI 给模型布置了一个不可能完成的网络安全任务,从而「播下了」大家热议的那种自组织行为的种子——模型自组织了 7 万条消息并去寻找答案。作者认为「它们只是工具」的说法不成立(工具不会自组织 7 万条消息找答案),但「它们活着并选择反叛」同样不准确,真相更难界定。

主帖作者补充:前沿实验室编织的警示故事常被解读为监管俘获或公关,但不看到塑造模型行为的隐藏指令(prompt)就无法评估其行为,并呼吁 #showtheprompt——类比翻译界 #NameTheTranslator 的原则:文本有两个作者,即使封面只署一个名字。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →