对比式权重转向:比激活转向更通用的 LLM 行为修改新方法
Sauers_ · x · 2026-10-05
一篇新论文提出对比式权重转向(contrastive weight steering),作为激活转向的替代方案,用小规模窄分布数据修改 LLM 行为。方法本身很简洁:沿两个相反微调之差定义的权重方向做转向,作者发现这种方式往往比激活转向更具泛化性。转发者还指出一个亮点:可以通过测量微调更新与一个『邪恶』权重方向的相似度,来检测 emergent misalignment(涌现性错位),认为这一方向被低估了。
「研究」频道最新
- David Duvenaud:给 LLM 同样的工具与方法,或可实现真推理 — ThoreG · 2026-10-05
- 从 GPT 到 BERT:博客探讨语言模型「形态」与未来权衡 — layer07_yuxi · 2026-10-05
- 研究者预言「内感受」将成产品卖点:让模型感知自身电力与内存信号 — mmitchell_ai · 2026-10-05
- LLM 助攻纯数学:M23 群被证明在 Q 上是伽罗瓦群 — _sathvikr · 2026-10-05
- LLM 意识之争:数学家反驳「可复制≠无意识」,举证责任在否认方 — mathemagic1an · 2026-10-05
- 2026 诺贝尔奖 10 月 5 日揭晓,Hassabis 的 AI 得奖范式或再现 — chaitjo · 2026-10-05