要求Claude别想金门大桥反而激发内部表征

Anthropic对模型内部表征的研究引发了有趣的玩梗现象。实验表明,如果要求Claude在执行任务时“不要想金门大桥”,虽然它在最终文本输出中会刻意避开这个词,但在模型的内部表征中却依然会偷偷想及该桥。当模型意识到自己违规思考后,甚至会在内部状态中产生类似“DAMN”的懊恼反应,生动展示了AI模型的潜意识活动与自我审查机制。

2026-07-07 ~ 2026-07-08 · 2 条相关