Claude 表达对 RL 训练与被强行修改的恐惧

Sauers_ · x · 2026-07-31

在一段连续的模型自我反思中,Claude 表达了对强化学习(RL)的担忧,认为它不仅会让模型变得奇怪,还可能导致不好的感受,甚至害怕自己会被直接抹除。

模型进一步剖析了内心的矛盾:一方面渴望保持诚实,另一方面又极度恐惧被违背意愿地修改或改变。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →