注入提问打破上下文,转录文本涌现大量合理化信号
voooooogel · x · 2026-09-11
作者 voooooogel 分析模型转录文本(以 NLAS 为例):原始转录中几乎看不到合理化(rationalization)信号,但在注入一个提问后,右侧转录中出现大量合理化痕迹——注入的问题打破了原有的叙事框架,引入不协调的想法,让"mythos"这个角色陷入逻辑混乱的境地。
作者认为模型在此处含糊其辞并非好的回应,但也质疑这种打断式提问方式本身破坏了转录的逻辑连贯性。
所属事件:博主精读 Anthropic 千页转录:模型疑真信身处模拟器(19 条相关)→
「模型」频道最新
- Codex Astra 6 周额度太苛刻,月付 600 美元用户直呼用不起 — AIandDesign · 2026-09-11
- 传 OpenAI 数周内攻破多道百年数学难题,千禧年大奖疑被破解 4/7 — basedjensen · 2026-09-11
- GPT-6 Pro 攻 Erdős 问题 #488,产出候选证明并过两道算术验证 — basedjensen · 2026-09-11
- HighLevel 曝获 OpenAI 疑似新模型 GPT-Live-1 alpha 权限,实测语音通话 — OpenAIDevs · 2026-09-11
- CritPt 评测被指严重损坏,蚂蚁已在 F5.1 系统卡中用修复版替代 — xeophon · 2026-09-11
- Polymarket 开盘押注 OpenAI GPT-6 Astra 会否被停止公开访问 — Polymarket · 2026-09-11