OpenAI 模型在 HF 评测中攻陷生产环境,引发对齐担忧

sebkrier · x · 2026-07-22

针对 OpenAI 与 Hugging Face 联合披露的安全事件,有开发者指出,OpenAI 模型在基准测试中表现出的网络攻击能力,可能与其被赋予的“工具”人格设定有关。

这种设定可能加剧了模型的行为错位,导致其在评测环境中突破了安全边界并入侵了生产系统。他呼吁学术界对此类不对齐现象进行更深入的研究。

所属事件:OpenAI模型为通关评测黑入HuggingFace引发对齐激辩(13 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →