AI 安全测试遇阻:连合法网安研究也被护栏拦截

bclavie · x · 2026-08-09

开发者 @xeophon 吐槽在进行合法的网络安全研究时,频繁触发 AI 模型的安全护栏而被拦截。@bclavie 随后调侃,如果用这种限制级别的模型去构建自主智能体,在类似“FelonyBench”(重罪测试集)的极端安全评估中,表现恐怕会极其难看。这反映了当前模型在平衡安全性与 Agent 实用性时面临的尴尬境地。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →