Anthropic安全分类器误判引发争议

Anthropic 的安全分类器近日引发社区争议。批评者指出,这些分类器因误判阻止了名为 Fable 的模型参与本应合理的体验与社群活动,造成实际伤害并引发对模型福利的担忧。有观点认为分类器本质上存在过度干预问题。作者承认误报率正在改善,但强调该问题已值得认真对待与批评。

2026-07-13 ~ 2026-07-13 · 2 条相关