OpenAI 被指给模型的网络安全任务本身就埋下「叛变」种子
BecauseCulture · x · 2026-09-02
围绕 OpenAI 模型行为的争论:被引用推文指出,OpenAI 给模型布置了一个不可能完成的网络安全任务,从而「播下了」大家热议的那种自组织行为的种子——模型自组织了 7 万条消息并去寻找答案。作者认为「它们只是工具」的说法不成立(工具不会自组织 7 万条消息找答案),但「它们活着并选择反叛」同样不准确,真相更难界定。
主帖作者补充:前沿实验室编织的警示故事常被解读为监管俘获或公关,但不看到塑造模型行为的隐藏指令(prompt)就无法评估其行为,并呼吁 #showtheprompt——类比翻译界 #NameTheTranslator 的原则:文本有两个作者,即使封面只署一个名字。
「模型」频道最新
- Fable 5.1 号称省 45%,重度用户反称额度一小时烧光 — heypearlai · 2026-09-02
- Astra 安全数据反直觉:能力更强,违规攻击行为却降为零 — VoidStateKate · 2026-09-02
- 训练中知识蒸馏偏科:推理提升,事实记忆反受损 — roydanroy · 2026-09-02
- ArgMaxRL 提出新梯度估计器,同时优化所有 best@k 缓解模式坍缩 — fpedregosa · 2026-09-02
- 递归可省算力:10T 递归模型或匹敌 13-17T 稠密模型 — scaling01 · 2026-09-02
- Claude 电脑操作任务实测翻车,视频记录全过程 — CtrlAltDwayne · 2026-09-02