Anthropic 全球工作区论文暗示 LLM 里存在固定语义坐标系
tszzl · x · 2026-07-26
- 作者认为,Anthropic 最近关于 LLM global workspace 的论文,为“中文房间”问题提供了新的解释线索。
- 他最惊讶的点是:把不同上下文下的 Jacobian 做平均后,竟然还能得到有意义的读出,能判断某一层的某个 token 会生成什么词。
- 这意味着,LLM 在中间层可能存在一个固定的语义坐标系,而不是同一个词在不同语境里指向完全不同的方向。
- 按这个理解,不同层之间是在共享的语义“语言”里互相传递信息,最终再组合成输出。
「漫话AGI」频道最新
- Anthropic 内部爆料:并非人人都持高 p(doom) 灾难论 — anpaure · 2026-09-11
- 前 OpenAI、Anthropic 预训练研究员辞职:两公司正赌上人命冲向自我改进超级智能 — ShakeelHashim · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- AI 陪伴的隐秘代价:它消解了建立真实亲密关系所需的摩擦 — YogeshMalik · 2026-09-11
- Wired 深度解析:为何众多 AI 研究者担心机器威胁人类生存 — wiredmagazine · 2026-09-11
- 「幻觉」或是范畴错误:把 AI 叫智能正在限制我们的想象 — Genaforvena · 2026-09-11