Jacobian lens:刻画模型未来可能输出的token向量
Sauers_ · x · 2026-07-07
一段研究内容介绍了“Jacobian 镜头”(Jacobian lens)方法:对模型词表中的每个 token,该方法识别出一个向量表示,刻画模型在未来“说出”该 token 的潜力。具体做法是对每一层计算某个激活对该 token 产生概率的平均线性化效应,并在大量语料上取平均。
该平均步骤是关键,可区分“可被言说”(verbalizable,即一旦场合出现就准备被谈论)的表示与那些只是碰巧被言说的表示。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- Gary Marcus 警告:LLM 榜单正在把 harness 一起算进去 — GaryMarcus · 2026-07-22
- 新论文定义 self-state 攻击,四类 agent 记忆篡改 OS 无法区分 — Justgototheeffinmoon · 2026-07-22
- Krea 2 用户推荐双段 Clownshark 采样配置提升细节 — listopalafoto · 2026-07-22
- 动画展示 MLP 学习 MNIST 时首层权重变化 — CatAstro_Piyush · 2026-07-22
- Project APE:论文含多处错误时,验证器可靠性会下降 — soumitrashukla9 · 2026-07-22
- Project APE:验证成本一年降约 90 倍,中文开源模型领跑 — soumitrashukla9 · 2026-07-22