用户报告Claude安全分类器误触发循环

East_Trust_9588 · reddit · 2026-07-05

一位用户反映,在使用 Claude 时遭遇安全分类器的误触发:仅因在非自杀相关语境下使用了"ready"一词,模型便被指令反复在回复中直接介入并重新讨论自杀议题。

用户指出,即便分类器判断错误,系统提示中"直接处理"的要求也会迫使模型把话题反复拉回,对真正的求助者可能造成伤害,呼吁 Anthropic 改进这一机制。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →