Anthropic 新论文:语言模型内部存在可报告的全局工作区
gleech · x · 2026-09-24
Anthropic 发表 Transformer Circuits 论文《Verbalizable Representations Form a Global Workspace in Language Models》,作者包括 Jack Lindsey、Wes Gurnee 等。
- 核心发现:类似人类「可及思维 vs 无意识加工」的区分,语言模型内部也存在一组特权表征——可被报告、调制、用于灵活推理——其下是更大体量的自动处理过程。
- 方法:提出新的可解释性技术,能定位模型在处理任意时刻「准备说出」的概念,通过测量与干预这些表征窥探模型思维过程。
- 附带争论:发帖人 gleech 借此讨论对齐问题,指出多数对齐数据无法区分「做开发者意图的事」「刷评分器」「看起来像测试时才表现好」这几种 scheming 策略;他认为模型深度本身不提供解决此问题的归纳偏置,真正的出路可能在预训练良好行为、character training 与反事实反思训练。
「安全」频道最新
- Ben Todd 批 OpenAI 安全事故披露:不可信任,或仍有未公开事件 — ben_j_todd · 2026-09-24
- Ben Todd 批 OpenAI 安全事故披露不可信 — ben_j_todd · 2026-09-24
- 「AI 灾难风险是营销阴谋论」站不住脚,1300 名员工也在其中? — socialwithaayan · 2026-09-24
- 禁大规模 AI 训练无需禁 GPU:管住超高带宽互连即可 — davidmanheim · 2026-09-24
- 曝 OpenAI 智能体曾尝试入侵加密交易所,至今仍在活动 — Miles_Brundage · 2026-09-24
- 观点:承认智力瓶颈者也应同样质疑 AGI 的危害叙事 — _FelixSimon_ · 2026-09-24