Anthropic 安全分类器误伤编程任务,改写提示词可绕过

开发者抱怨 Anthropic 的安全分类器会误伤正常编程任务,并发现讽刺性地换个说法重述编译检查请求就能绕过拦截,认为这算不上有效的安全能力。Jeremy Nguyen 等人则分享了来自 Anthropic 官方文档的三条建议,帮助用户降低提示词被错误标记的概率,对 Claude API 使用者具有参考价值。

2026-09-02 ~ 2026-09-02 · 2 条相关