AxBench 基准:简单基线胜过稀疏自编码器 SAE

aryaman2020 · x · 2026-09-02

斯坦福等机构发布了 AxBench,这是首个用于大模型操控和概念检测的大规模基准。论文在 Gemma-2-2B 和 9B 上的实验结果表明:

此外,论文提出了一种新的弱监督表示方法 ReFT-r1,兼具竞争力和可解释性。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →