运行时激活引导:减少 Qwen 和 Gemma 的阿谀行为
ASL_Dev · reddit · 2026-08-26
在 Qwen 3.5 和 Gemma 4 (2B/4B) 小模型上测试“运行时激活引导”技术,旨在不修改权重的情况下减少模型的阿谀行为。
方法原理:
- 逐层检查是否存在一个方向,能区分“正确抵抗用户错误压力”和“阿谀顺从”的行为。
- 在推理时,将模型的激活向该方向的反向引导。
实验结果:
- 4B 模型:在减少阿谀行为方面改善显著,且未显著增加固执性(Gemma 4 固执性略增,Qwen 较少),同时在 GSM8K 任务上保持了准确率。
- 2B 模型:对引导几乎没有反应。
作者提供了代码和论文链接,并计划在更大的模型(如 Qwen 3.8)上进行测试。
「研究」频道最新
- 实测四大 Agent 框架:LLM 评审范式完全失效 — MonokoEloba · 2026-08-26
- MIT 教授解析为何 AI 仍无法洗碗,谈物理交互 — vincesitzmann · 2026-08-26
- Adaptyv 融资 4000 万美元,建「生物超级工厂」让 Claude 设计蛋白 — ycombinator · 2026-08-26
- 菲尔兹级数学家评 AI 证明 S^6 复结构:粗看相当可信,系领域中心问题 — littmath · 2026-08-26
- 机器人基础模型自我提升:Q-Planning将成功率25%提至80% — chris_j_paxton · 2026-08-26
- 在提示词里直接运球?绕过 AI 水印的理论探讨 — JulianHabekost · 2026-08-26