Anthropic 新论文:语言模型内部存在可言语化的「全局工作区」
rgblong · x · 2026-10-10
Anthropic 在 Transformer Circuits 发布新论文《Verbalizable Representations Form a Global Workspace in Language Models》,由 Jack Lindsey、Wes Gurnee 等核心成员完成。
核心发现:
- 语言模型内部涌现出类似人类认知的功能分层:一小部分 privileged 表征可被报告、调节并用于灵活内部推理,其下是大量自动化的处理过程
- 团队提出新的可解释性技术,能在模型处理任意时刻浮现出「即将被言语化」的概念,通过对这些表征的测量与干预窥探模型的思考过程
- 研究者认为即便抛开意识/全局工作区理论(GWT)的解读,这也是对模型「丰富内部世界」的有力刻画
讨论中有人推荐配套阅读 jspace 论文及相关评论文章。
「研究」频道最新
- 开发者发布 Mnemos:受神经科学 engram 启发的 Agent 记忆架构 — RileyRalmuto · 2026-10-10
- LLM 工作流从多语言公民科学评论中采集物种互动观察 — abenitezburraco · 2026-10-10
- MIT 研究者谈进化搜索:变异只需 1% 有效就能持续进步 — Machine Learning Street Talk · 2026-10-10
- AI 文本检测器对 Meta 新模型改写摘要漏检近 80%,研究警示筛查失效 — rohanpaul_ai · 2026-10-10
- AI 翻译或改变谁能参与学术对话,但小错误可颠倒结论 — yi111 · 2026-10-10
- 用向量数据库替换权重矩阵,提出检索中心深度学习 — RobertTLange · 2026-10-10