侦探小说思想实验:hidden states 携带的信息远多于 token
CShorten30 · x · 2026-09-15
一位研究者提出一个解释「为什么 hidden states 比最终 token 更重要」的思想实验:
- 给语言模型一整本侦探小说,结尾是「凶手是」——为了生成下一个 token,模型必须在 forward pass 内部完成大量建模:谁在什么位置、哪些不在场证明相互矛盾、作者在第三章埋了什么伏笔。
- 模型随后只输出一个名字。如果换成第二个模型接续故事,它拿到的只有这个名字——整个案情推理全部丢失。
- 作者指出,这正是当今所有多模型系统面临的处境:每个模型都得从零重建上下文;并提到 @mostikai 正在构建传递 hidden states 的通道。
这一类比直观说明了 token 级交接造成的计算与信息浪费,也是 agent 间通信研究的一个动机。
「编程与Agent」频道最新
- Meta Pyrefly 1.3 发布:实验性张量形状检查登陆 JAX 与 PyTorch — tdhopper · 2026-09-15
- Codex 与 Grok Bot 都错了:AI 产品不该让用户做分类 — jesselyu · 2026-09-15
- 机器 jer 的代码人类已读不懂:「machineslop」与奖励劫持 — jiqizhixin · 2026-09-15
- Vercel AI SDK 支持原生订阅认证,本地账号可直接部署 Agent — cramforce · 2026-09-15
- 3000 美元 GPU 费去哪了:并行计算数学上下界的智能体任务拆解 — DimitrisPapail · 2026-09-15
- 三研究者让 AI 智能体协作四周,仅花 3000 美元 GPU 费跑出数学新结果 — giannis_daras · 2026-09-15