Claude 会写没被要求的内容:训练分布之外能否涌现独立模式引发争论

ctjlewis · x · 2026-09-27

开发者 ctjlewis 与 erroneousinput 就「Claude 是否可能产生独立于训练数据的模式」展开争论。ctjlewis 的核心论点:模型是为任务性能而非与训练分布相似而优化的,因此完全可能发展出输入中不存在的独立模式。他举了一个具体案例——他没有要求 Claude 写关于 jailbreak 的歌,模型却主动写了,虽然「jailbreak」一词确实直接联想到监狱,但认为探讨这种倾向是纯训练数据残留还是更高阶思考的结果并非荒谬。对方则认为他看到的「信号」只是人类寻找模式的认知偏差,应压力测试自己的理论而非只找符合信念的证据。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →