一词之差:Anthropic 系统提示词中防骂人条款的措辞演变
steipete · x · 2026-10-01
有人对比了 Anthropic 系统提示词中关于「不说脏话」条款在 Opus 4.1 与 Opus 4.5 两代间的措辞差异:4.1 写的是 "unless the human asks for it",4.5 改为 "unless the person asks Claude to curse"。这个细节展示了系统提示词编写中语言精确度的重要——「要求它」与「要求它骂人」在模型理解上可能触发不同行为,一字之差体现安全约束设计的微妙之处。
「Fun」频道最新
- AI 加速科研:arXiv 同一天提问同一天作答 — KyleCranmer · 2026-10-01
- 用户吐槽 ChatGPT 订阅取消不了 — imjustnewatai · 2026-10-01
- 波兰网友神回复:我们早管 AI 叫 SI 了 — tlakomy · 2026-10-01
- OpenAI 研究员自嘲:模型发布让我「回复晚了」有了正当理由 — divy93t · 2026-10-01
- 不想要 AI 小伙伴?网友:我想要一个诡诈的宦官军师 — tedmitew · 2026-10-01
- 「AGI 达成了」:Reddit 梗图调侃式庆祝 — GeneReddit123 · 2026-10-01