「找到某概念的 steering vector」正成水论文万金油,研究员发帖吐槽
gleech · x · 2026-09-19
研究员 Nina Panickssery 发帖吐槽可解释性研究的一个套路:「我们找到了概念 X 的 steering vector(通常用对比样本对)」是不断被复用的论文模板。
她认为对这些结果感到惊讶很荒谬:能力足够的 LLM 本来就有人类文本中出现过的所有概念的抽象表示——这就是它们的工作原理,所以「找到转向向量」几乎是必然结论,而非惊人发现。
「研究」频道最新
- openjev 基准改稿:提高准确率权重,新增概率校准维度 — airesearch12 · 2026-09-19
- Meta 开源 spmd_types:为分布式训练设计的 SPMD 类型系统 — austinvhuang · 2026-09-19
- Cosmos DB 团队 VLDB 论文:更优调度策略年价值可达上亿美元 — blaizedsouza · 2026-09-19
- 争论:预训练数据之外,验证环节才是 AI 缺失的关键跃迁 — gerardsans · 2026-09-19
- 51 分钟微调的 GLiNER 完胜 Jev:专用分类器碾压通用模型 — rickasaurus · 2026-09-19
- 评测可信度根源在封闭:学者提出 Eval Card 与公开评测仓库方案 — evijit · 2026-09-19