Tara Research 发布新论文:用更低能力损耗提升模型诚实性
irinarish · x · 2026-07-24
Tara Research 介绍自己是一家独立、非营利的 AI 安全机构,目标是衡量模型“说谎”的倾向,并公开评估各种安全技术对抗欺骗的效果。
他们的首篇公开论文是 《Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence》。文中提出两种“投影感知”的 steering 方法,只修正那些激活值落在已学习决策边界错误一侧的 token。作者声称,这种方法在恢复诚实性方面,效果接近传统的统一 steering,但对模型能力的损耗更小。帖子后半段还提到有额外发现,但原文在这里截断了。
「研究」频道最新
- 为什么 evals 可能是企业级 AI agents 的缺失一环 — eptwts · 2026-07-24
- 无需反向传播训练 CNN:MNIST 准确率达 96.7% — burkov · 2026-07-24
- 微软研究院 SkillOpt 用文本优化技能,六基准 52/52 — eyishazyer · 2026-07-24
- Science 论文揭示阿尔茨海默病单细胞 3D 基因组重组 — jmuiuc · 2026-07-24
- 用音乐控制图像生成:SDXL Turbo 特征调控硬核实践 — Sauers_ · 2026-07-24
- 5种LLM量化技术详解:如何在单GPU运行70B模型 — Roger_M_Taylor · 2026-07-24