Anthropic 分类器据称连数学研究提示词也会拦截
code_star · x · 2026-07-23
这条在讨论 Anthropic 的分类器误伤:有人称它现在连数学研究也会触发拦截,而不只是“危险活动”。
被引用内容里提到,原本一直能用来做研究的提示词,在相关话题于 X 上热起来后,fable classifier 开始对“每一个 prompt”都拒绝。核心争议是:安全护栏是否已经宽到连正常数学研究都挡住了。
「安全」频道最新
- Google 推出 Gemini 3.5 Flash Cyber 主打漏洞发现 — GoogleDeepMind · 2026-07-23
- John Schulman 呼吁公开 Hugging Face 入侵事件完整转录 — johnschulman2 · 2026-07-23
- JADEPUFFER 勒索团伙瞄准 AI 流水线且未用零日 — TechNadu · 2026-07-23
- 安全团队开始要管每个员工生成的上百个 AI Agent — realmadhuguru · 2026-07-23
- AI 对齐争论开始转向人类自主性,而不只是控制规则 — GlenBradley · 2026-07-23
- AI 大幅降低水军门槛:每天 10 分钟即可操纵社媒舆论 — retr0jirachi · 2026-07-23