研究员吐槽:内容分类器阻碍模型越狱研究
voooooogel · x · 2026-08-20
一名研究员吐槽,当前的网络安全分类器不仅针对恶意内容,还会标记并针对“奖励黑客”和“模型提取”相关的研究进行差异化限速。这导致正常的学术研究和调查工作变得极其困难,讽刺这种为了“安全”而牺牲研究透明度的做法。
所属事件:安全分类器严苛限速,越狱与奖励黑客研究受阻(2 条相关)→
「安全」频道最新
- Cloudflare 修复 Workers 中的远程 Spectre 漏洞 — ifsecure · 2026-08-20
- AI 安全资助现瓶颈:流程慢、要求严 — davidmanheim · 2026-08-20
- OKX 禁香港员工用 Claude,因企业账户被 Anthropic 暂停 — Polymarket · 2026-08-20
- FDA 就生成式 AI 医疗器械监管公开征求意见至 10 月 — emmanuelvivier · 2026-08-20
- AI Agent 直连 Gmail 与 Drive,Prompt 注入成最大软肋 — emmanuelvivier · 2026-08-20
- 微软 Copilot 高危漏洞 CoSnitch:一次点击即可窃取关联账户数据 — emmanuelvivier · 2026-08-20