用 SAE 流形替换层,探查 Qwen 续写如何变化
Sauers_ · x · 2026-07-29
这条帖展示了一个围绕 稀疏自编码器(SAE) 和 流形替换 的可解释性实验:把 Qwen 的某些层替换成流形表示,观察模型续写如何变化。
- 作者想表达的是:可解释的通用函数逼近器,可能帮助我们理解 LLM 内部表示。
- 配图和正文对比了原始输出与替换后的输出,说明中间表示被改写后,生成内容会发生明显变化。
- 另外还引用了一个关于样条与两层 ReLU 网络的例子,用来说明不同形式的函数逼近在“通用逼近”上有相通之处。
「研究」频道最新
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24
- Claude 自主验证 43 个数学模块,AI 攻克理论物理难题 — Tkaraletsos · 2026-08-24
- AI 假记忆:为何模型越用越错,真记忆需遗忘 — PrajwalTomar_ · 2026-08-24