一篇新论文让 LLM 学流形特征,而不是线性 SAE 方向
Sauers_ · x · 2026-07-27
这条内容介绍了一篇关于 LLM 无监督学习 manifold dictionary 的论文。
- 传统 SAE 把特征看成“方向”,而这篇工作把特征扩展成“流形”,并为每个 token 学习其在流形上的坐标。
- 作者认为,很多概念并不是激活空间里的直线,因此用流形来表示可能比线性方向更合适。
- 研究的一个核心动机是 steering:与其把某个特征直接叠加到当前状态上,不如沿着流形移动,从而尽量保持在分布内。
- 文章也强调了优化难点:流形的拓扑、位置、尺度、弯曲程度以及特征数量都彼此耦合。
整体上,这是一个比线性 SAE 更灵活的表示方式,尤其适合像星期几这种循环结构或其他非线性概念。
「研究」频道最新
- AgentPrune 让多智能体通信成本从 43.7 美元降到 5.6 美元 — sebkrier · 2026-07-27
- 一种新因果建模图把排序、上下文和邻接都纳入结构 — KordingLab · 2026-07-27
- WMO 推出模型路由器,称可把 agent 成本降 40%+ — SilenN · 2026-07-27
- 前沿 LLM 能多找十倍问题,但评审不是拼找茬数量 — gleech · 2026-07-27
- COLM 2026 论文可走可行动解释性工作坊快通道 — sarahwiegreffe · 2026-07-27
- 推理研究最大变化:从符号轨迹走向自然语言 — denny_zhou · 2026-07-27