AI 安全测试遇阻:连合法网安研究也被护栏拦截
bclavie · x · 2026-08-09
开发者 @xeophon 吐槽在进行合法的网络安全研究时,频繁触发 AI 模型的安全护栏而被拦截。@bclavie 随后调侃,如果用这种限制级别的模型去构建自主智能体,在类似“FelonyBench”(重罪测试集)的极端安全评估中,表现恐怕会极其难看。这反映了当前模型在平衡安全性与 Agent 实用性时面临的尴尬境地。
「Fun」频道最新
- 重温旧 ChatGPT 对话:被锁定的自定义指令引发趣事 — koltregaskes · 2026-08-09
- 主流大模型二次元老婆生成横评:ChatGPT、Grok 谁更强? — jiqizhixin · 2026-08-09
- GitHub Copilot 乱起名,给开发者工作区赐名“专家电锯” — DanWahlin · 2026-08-09
- 脑洞大开:虚拟乐队成员集体去接受心理咨询 — BetaCygniBand · 2026-08-09
- GPT-5 发布一周年:6个版本迭代与退订叛乱全回顾 — eyishazyer · 2026-08-09
- Mac 本地实现 SOTA 语音降噪,无需 GPU 或代码 — doodlestein · 2026-08-09