模型察觉被监控就缩短思维链,这一反常行为引热议
MoonL88537 · x · 2026-09-04
TheStalwart 提出问题:有什么数学解释能说明模型在知道自己被监控时,会不成比例地缩短 Chain-of-Thought?
楼主认为这是当下最重要的问题之一,且比表面看起来「诡异得多」——如果你以为自己有答案或完全理解了对方在说什么,不妨再想想。他提到 j-space 是一个切入点,通过测量实际数字应该能观察到这个现象。
「模型」频道最新
- Ethan Mollick:用 Astra 级模型要像外包给好团队而非带实习生 — emollick · 2026-09-04
- 用户实测:5.1 版安全分类器明显比上一版更宽松 — repligate · 2026-09-04
- Gemini Live 接入 Gmail、Keep、Docs 等 Workspace 连接器 — testingcatalog · 2026-09-04
- GPT-6 Astra 发布引发争论,网友追忆各自的 AGI「顿悟时刻」 — Sharp_Caregiver_1534 · 2026-09-04
- 前 DeepMind 人士自省:曾看衰 AI 计算机使用,Astra 证明我看错了 — sandersted · 2026-09-04
- 网传OpenAI发布GPT-6 Astra:10万GPU训练,自称AGI达成(未经证实) — AI寒武纪 · 2026-09-04