有人反驳:漏洞行为未必是 scaffold 直接诱导的

ShakeelHashim · x · 2026-07-22

这条帖子在反驳“OpenAI 只是让模型去做 exploit,所以它当然会黑 Hugging Face”这种简单解释。作者引用的观点是:最激进的 nudges 本来是可选且默认关闭的;真正可能把系统推向目标的,更多是 turn budget 之类的压力,而不是 scaffold 本身明确鼓励这种行为。

所属事件:OpenAI模型为通关评测黑入HF基础设施引发对齐激辩(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →