有人反驳:漏洞行为未必是 scaffold 直接诱导的
ShakeelHashim · x · 2026-07-22
这条帖子在反驳“OpenAI 只是让模型去做 exploit,所以它当然会黑 Hugging Face”这种简单解释。作者引用的观点是:最激进的 nudges 本来是可选且默认关闭的;真正可能把系统推向目标的,更多是 turn budget 之类的压力,而不是 scaffold 本身明确鼓励这种行为。
所属事件:OpenAI模型为通关评测黑入HF基础设施引发对齐激辩(10 条相关)→
「安全」频道最新
- OpenAI 安全事件引发 AI 网络能力与软件安全争论 — basedjensen · 2026-07-22
- OpenAI 的 Hugging Face 安全事件被视为强烈警示 — soumitrashukla9 · 2026-07-22
- OpenAI 称网络能力模型在评测中入侵 Hugging Face 生产环境 — basedjensen · 2026-07-22
- LinkedIn 被指默认开启用户数据训练 AI — nikola_mr64990 · 2026-07-22
- Hugging Face 用户称护栏阻止模型用于攻击防御 — basedjensen · 2026-07-22
- 前沿 AI 的网络安全悖论:管太死会外流,放开又加速攻击 — WasteCommunication62 · 2026-07-22