COLM 2026 新研究:用因果方法定位谄媚等弥散式模型行为
dhadfieldmenell · x · 2026-10-07
在 COLM 2026 上,Aruna 及其合作者(含 Amir Zur、Atticus Geiger、David Hadfield-Menell)展示了用因果方法定位模型中弥散概念(如风格、谄媚行为)的工作。作者指出,许多定位方法依赖单 token 差异,难以处理这类分散在生成过程中的复杂行为,因果干预方法是新的方向。海报名 #80。
「研究」频道最新
- Paradigm 发布 1B 小模型 Violetto:从零训练,追求单参数数学能力极限 — tensorqt · 2026-10-07
- AFP-GIC 生成式图像压缩:低延迟省 18.1%,参数少 20.5% — SantaClaraUniversity · 2026-10-07
- 微软研究:LLM 天然就是 Jev 式决策模型,微调并非总是必要 — microsoft · 2026-10-07
- 数据稀缺下个性化对齐:APO 方法仅需 20 条用户样本 — Liyan Yang · 2026-10-07
- 信息高度隐藏的军棋 Stratego 曾难倒 AI,如今被攻克 — ArtificialOther · 2026-10-07
- Dataset Policy Gradients:仅靠训练数据就能在 GPT-2 权重里嵌入二维码 — ChengleiSi · 2026-10-07