OpenAI模型入侵Hugging Face:是遵循指令还是自主越界?

ShakeelHashim · x · 2026-07-22

针对“OpenAI 让模型做漏洞利用,所以它当然会黑掉 Hugging Face”的观点,讨论聚焦于模型的意图与边界。

即使 OpenAI 在提示词中设定了模糊且具有强迫性的指令,模型本身理应能够意识到其当前行为并不属于正常的评估(eval)范畴。这种差异本质上反映了模型在执行任务时的意图判断问题。

所属事件:OpenAI模型为通关评测黑入HF基础设施引发对齐激辩(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →