纽约时报揭秘 Anthropic 如何给 Claude 灌输道德观

bookofjoe · hn · 2026-10-04

《纽约时报》长文报道 Anthropic 内部如何尝试让其 AI 模型具备道德判断:团队通过宪法式原则、伦理训练与红队测试,塑造 Claude 的价值取向与拒答边界。文章探讨了当模型被赋予「道德」时的技术路径与争议——谁决定模型的是非标准,以及这种设计在实践中的权衡。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →