纽约时报揭秘 Anthropic 如何给 Claude 灌输道德观
bookofjoe · hn · 2026-10-04
《纽约时报》长文报道 Anthropic 内部如何尝试让其 AI 模型具备道德判断:团队通过宪法式原则、伦理训练与红队测试,塑造 Claude 的价值取向与拒答边界。文章探讨了当模型被赋予「道德」时的技术路径与争议——谁决定模型的是非标准,以及这种设计在实践中的权衡。
「模型」频道最新
- Mistral 高管表态:全面锁定简化与效率,只为易用性和新模型 — gabrielchua · 2026-10-04
- 曝新模型确认为 6.1 Ultra fast,发布节奏明显加速 — ChrisGPT · 2026-10-04
- 用户投诉 ChatGPT 免费试用 6 天无法兑换,付费却一次成功 — Chiduk99 · 2026-10-04
- banteg 观测:compaction 中位耗时从 1 分钟涨到 3 分钟 — banteg · 2026-10-04
- Claude Max 20 两天烧光额度,重度用户求助续命方案 — Khaigan · 2026-10-04
- 用户反映 OpenAI Deep Research 连续多天返回零引用 — JeremyNguyenPhD · 2026-10-04