Tinfoil 团队:开源安全分类器研究严重稀缺,呼吁头部实验室开放
yuntiandeng · x · 2026-09-15
AI 安全初创 Tinfoil 公开致谢 OpenAI(gpt-oss-safeguard)、WildChat(作者 yuntiandeng)、HarmBench(CAIS/Mantas Mazeika)与 Anthropic 的 safeguard 相关工作,并表示在梳理过程中发现:开源社区在安全分类器(safety classifiers)方向的工作出奇地少。
团队借此呼吁前沿实验室和其他组织发布更多可被广泛研究与部署的开源安全防护,让任何 AI 部署都能低成本、便捷地内置安全机制,并表示愿为这一生态的发展贡献力量。
「模型」频道最新
- NSA/FBI/CISA 指控 DeepSeek 等六家中国实验室工业级蒸馏模型 — emmanuelvivier · 2026-09-15
- 传 OpenAI 暂停 $200 ChatGPT Pro 新订阅,称 GPT-6 Astra 需求挤爆容量 — emmanuelvivier · 2026-09-15
- TerminalBench 计分口径不一:Astra 触发安全得 0 分,Fable 却换模型续跑 — xeophon · 2026-09-15
- 用量化金融类比 AI 竞赛:大厂先发优势终将随算法公开而消散 — willcb · 2026-09-15
- 覆盖度实测三轮:DeepSeek V4.1 Flash 21.7→33 分 — PawelHuryn · 2026-09-15
- ChatGPT Plus 转 Business 值不值?用户求解 Sol High 用量上限差异 — geler1 · 2026-09-15