可解释性讨论:NLA 能否从激活中提取模型全部潜在信息
thebasepoint · x · 2026-09-27
围绕 NLA(自然语言消融)的一场可解释性讨论:作者提出一种理解框架——NLA 的一种目标是从激活中提取模型「原则上能说」的一切,而不受「助手此刻会说」的限制。他还提到 OpenAI 的 confessor training 似乎是想让这一性质成立的尝试,但自 1 月以来未见其原型之外的进展。这条对可解释性研究方向有实质信息量。
所属事件:可解释性研究者激辩 NLA 方法的能力边界(3 条相关)→
「研究」频道最新
- 零数据预训练:两模型自博弈生成数据可预测 scaling — AlexTensor · 2026-09-27
- 被低估的线性代数事实:图论与线性代数其实是同一门学科 — TivadarDanka · 2026-09-27
- 图论与线性代数是同一门数学,只是穿了不同外衣 — TivadarDanka · 2026-09-27
- 用神经细胞自动机+RL 生成器合成数据训练语言模型引热议 — cephaloform · 2026-09-27
- 网友追问 OpenAI 纳维-斯托克斯解是否有外部数学家验证 — miniapeur · 2026-09-27
- AI 重写自身评测框架八天:递归自我改进的首个证据? — Machine Learning Street Talk · 2026-09-27