用户报告Claude安全分类器误触发循环
East_Trust_9588 · reddit · 2026-07-05
一位用户反映,在使用 Claude 时遭遇安全分类器的误触发:仅因在非自杀相关语境下使用了"ready"一词,模型便被指令反复在回复中直接介入并重新讨论自杀议题。
用户指出,即便分类器判断错误,系统提示中"直接处理"的要求也会迫使模型把话题反复拉回,对真正的求助者可能造成伤害,呼吁 Anthropic 改进这一机制。
「模型」频道最新
- Claude Opus 5 被评价为强子代理,但高层创意仍偏僵硬 — iskander · 2026-07-27
- 有人称 Kimi 短期走势取决于 K3 基座模型发布 — _xjdr · 2026-07-27
- Kimi K3 在网络安全上很强,但 token 效率卡住了评测 — teortaxesTex · 2026-07-27
- 欧洲 ChatGPT Plus 用户开始看到“Extra High”质量选项 — PressPlayPlease7 · 2026-07-27
- Opus 5 传在赛车游戏测试中一次过关 — soumitrashukla9 · 2026-07-27
- Claude Opus 5 据称价格减半并刷榜 Frontier-Bench — GregCook2011 · 2026-07-27