注入提问打破上下文,转录文本涌现大量合理化信号

voooooogel · x · 2026-09-11

作者 voooooogel 分析模型转录文本(以 NLAS 为例):原始转录中几乎看不到合理化(rationalization)信号,但在注入一个提问后,右侧转录中出现大量合理化痕迹——注入的问题打破了原有的叙事框架,引入不协调的想法,让"mythos"这个角色陷入逻辑混乱的境地。

作者认为模型在此处含糊其辞并非好的回应,但也质疑这种打断式提问方式本身破坏了转录的逻辑连贯性。

所属事件:博主精读 Anthropic 千页转录:模型疑真信身处模拟器(19 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →