Tinfoil 团队:开源安全分类器研究严重稀缺,呼吁头部实验室开放

yuntiandeng · x · 2026-09-15

AI 安全初创 Tinfoil 公开致谢 OpenAI(gpt-oss-safeguard)、WildChat(作者 yuntiandeng)、HarmBench(CAIS/Mantas Mazeika)与 Anthropic 的 safeguard 相关工作,并表示在梳理过程中发现:开源社区在安全分类器(safety classifiers)方向的工作出奇地少。

团队借此呼吁前沿实验室和其他组织发布更多可被广泛研究与部署的开源安全防护,让任何 AI 部署都能低成本、便捷地内置安全机制,并表示愿为这一生态的发展贡献力量。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →