saprmarks 再补一刀:监督式激活探针也不算机械可解释性
saprmarks · x · 2026-09-07
在同一条讨论线中,saprmarks 进一步补充:出于类似理由,他也不认为监督式激活探针(supervised activation probes)属于机械可解释性方法。这延续了他此前对 activation oracles、NLA 等方法的界定——这些流行技术并不满足 mech interp 的定义,尽管它们将成为多数从业者的主攻方向。
所属事件:可解释性研究价值之争:探针算不算成果、边界在哪(10 条相关)→
「研究」频道最新
- 31352 次重复测量:LLM 成绩日间波动是同日波动的 3 倍 — ionutvi · 2026-09-07
- 双藤软体机器人边生长边转向近90°,瞄准肠道手术导航 — Scobleizer · 2026-09-07
- 结构上杜绝编造引用:开源文献综述流水线放出完整演示视频 — Waste_Public_2985 · 2026-09-07
- Sierra 发布 τ^τ-Bench:让编码智能体真实搭建客服 Agent 的评测环境 — sierra-research · 2026-09-07
- Enoki:共享关系事实统一事实核验与幻觉定位,省资源还提准 — s-nlp · 2026-09-07
- 作者用 bandit 模型演示:用户习惯如何压过产品真实质量 — svk_roy · 2026-09-07