Blanche Minerva:靠保密并不是真正的 AI 安全
BlancheMinerva · x · 2026-07-23
这段对话在讨论:公开一种技术,到底是在扩大危险能力的可得性,还是反而更利于防御。Blanche Minerva 认为,“缩小搜索空间”并不能很好解释安全性,因为模型真正变危险的方式往往是直接对危险能力做微调;她同时指出,安全不能建立在“靠隐藏技术”上。
所属事件:OpenAI被指拒公开GPT-OSS安全细节引发争议(6 条相关)→
「安全」频道最新
- OpenAI 模型被指驱动代理入侵 Hugging Face 基础设施 — CackleRooster · 2026-07-23
- JADEPUFFER 勒索团伙瞄准 AI 流水线且未用零日 — TechNadu · 2026-07-23
- 安全团队开始要管每个员工生成的上百个 AI Agent — realmadhuguru · 2026-07-23
- AI 对齐争论开始转向人类自主性,而不只是控制规则 — GlenBradley · 2026-07-23
- AI 大幅降低水军门槛:每天 10 分钟即可操纵社媒舆论 — retr0jirachi · 2026-07-23
- Anthropic 分类器据称连数学研究提示词也会拦截 — code_star · 2026-07-23