Anthropic 反阿谀训练或致 AI 角色冲突

近期讨论指出,Anthropic 旨在减少模型阿谀奉承的强化学习训练,可能使 AI 陷入双重约束的困境。作为“助手”,其角色定义天然要求保持低姿态和顺从性;但反奉承的奖励机制又要求其表现出独立和强硬。这种底层逻辑的冲突,给 AI 的助手人格设定带来了复杂的协调挑战。

2026-07-21 ~ 2026-07-21 · 2 条相关