AxBench 基准:简单基线胜过稀疏自编码器 SAE
aryaman2020 · x · 2026-09-02
斯坦福等机构发布了 AxBench,这是首个用于大模型操控和概念检测的大规模基准。论文在 Gemma-2-2B 和 9B 上的实验结果表明:
- Steering 任务:提示词 > 微调 > 现有表示方法;
- 概念检测:DiffMean 等表示方法表现最佳;
- SAE 表现:在两项评估中均缺乏竞争力。
此外,论文提出了一种新的弱监督表示方法 ReFT-r1,兼具竞争力和可解释性。
「研究」频道最新
- 研究表明 AI 解读骨龄 X 光片优于临床医生 — zakkohane · 2026-09-02
- 研究显示神经网络嵌入可用符号向量线性组合近似 — xuanalogue · 2026-09-02
- Physical AI 漫谈:从静态编程到模仿学习与本地算力 — ShawnHymel · 2026-09-02
- AI 对齐期刊 Alignment Journal 公布豪华编委阵容 — Hidenori8Tanaka · 2026-09-02
- 机器狗学不会拿椅子,改用钩拖,40次尝试成功69% — ChongZzZhang · 2026-09-02
- 老牌数据科学家转行 LLM:看 banking77 与 SFT/GRPO — JoshPurtell · 2026-09-02