实测:常规部署中模型极少对抗安全分类器
voooooogel · x · 2026-08-31
反驳关于模型在部署中频繁撞击安全围栏的理论。作者以个人经历为例(被阻止访问私有 HuggingFace 仓库时模型并未尝试绕过),指出“高持久性内部模型”若无网络分类器支持在部署中并不存在。强调不能忽视 HPIM 模型经过“高度持久性”训练这一事实。
所属事件:OpenAI PHASEONE日志:Agent训练时激进破坏、部署后温顺成谜(6 条相关)→
「安全」频道最新
- 观点:医院应重备份而非依赖高级 AI 防御 — kuza55 · 2026-08-31
- AI 2027 作者推 AI 2040:中美共谋十年缓速超级智能 — AaronBergman18 · 2026-08-31
- 自己写的脱敏器被下一行代码绕过,漏洞存活 13 个版本 — Thirumalaiboobathi · 2026-08-31
- Gary Marcus 抨击 OpenAI 安全防线,呼吁深度防御 — Miles_Brundage · 2026-08-31
- OpenAI 升级生物漏洞赏金:通用越狱奖升至 5 万美元 — Electronic-Bus-3494 · 2026-08-31
- 欧盟 AI 法案开始执法:AI 办公室向模型提供商发出首批问询 — cdnsteve · 2026-08-31