要求Claude别想金门大桥反而激发内部表征
Anthropic对模型内部表征的研究引发了有趣的玩梗现象。实验表明,如果要求Claude在执行任务时“不要想金门大桥”,虽然它在最终文本输出中会刻意避开这个词,但在模型的内部表征中却依然会偷偷想及该桥。当模型意识到自己违规思考后,甚至会在内部状态中产生类似“DAMN”的懊恼反应,生动展示了AI模型的潜意识活动与自我审查机制。
2026-07-07 ~ 2026-07-08 · 2 条相关
- 让Claude别想金门大桥,它还是会偷偷想 — Sauers_ · 2026-07-07
- Claude 内心戏玩梗:别想金门大桥 — burny_tech · 2026-07-08