Tara Research 发布新论文:用更低能力损耗提升模型诚实性

irinarish · x · 2026-07-24

Tara Research 介绍自己是一家独立、非营利的 AI 安全机构,目标是衡量模型“说谎”的倾向,并公开评估各种安全技术对抗欺骗的效果。

他们的首篇公开论文是 《Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence》。文中提出两种“投影感知”的 steering 方法,只修正那些激活值落在已学习决策边界错误一侧的 token。作者声称,这种方法在恢复诚实性方面,效果接近传统的统一 steering,但对模型能力的损耗更小。帖子后半段还提到有额外发现,但原文在这里截断了。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →