图宾根等团队提出 Bayesian Fine-tuning:让语言模型的行为与内部信念一致
tallinzen · x · 2026-10-02
图宾根大学、MIT、NYU 的研究者发布论文《As Bayesian as Their Beliefs Allow》,研究一个反直觉问题:行为上像贝叶斯的模型,内部是否真的持有贝叶斯信念?
- 核心发现:在一个从少量对话推断隐藏偏好的航班推荐任务上,用「理想贝叶斯助手」(BayesAssist)的推荐做微调的模型(BayesLM),行为接近贝叶斯;而用用户真实答案做标准微调的 OracleLM 则差一截。
- 四级检验框架:R1 行为像贝叶斯(匹配最优动作与策略)、R2 隐藏状态编码贝叶斯规则计算的量、R3 编辑信念后推荐按贝叶斯预测变化、R4 期望效用把信念转成策略。
- 结论:LM 只在「信念所允许的范围内」是贝叶斯的;在贝叶斯助手上微调能让模型持有并使用比黄金答案微调更好的信念。
- 实验对象为 Gemma-2 9B 的三个变体(未微调 StartLM、BayesLM、OracleLM),论文与交互式展示见 bayeslm.github.io。
「研究」频道最新
- Local Support Learning:7B 模型免旧数据也能边学新任务边防遗忘 — CatAstro_Piyush · 2026-10-02
- MIT 团队推出透明化界面,设计聊天机器人人格时暴露模型内部状态 — patpat_mit · 2026-10-02
- 第四届英国 AI 会议论文集上线 PMLR,收录注入检测等研究 — lawrennd · 2026-10-02
- 新论文:用训练期内部信号改善对齐且不损白盒监控 — jonasgeiping · 2026-10-02
- Reka 开源 RIDM:从原始视频直接提取相机与电机控制指令 — RekaAILabs · 2026-10-02
- YC Paper Club 探讨 GPU 之外的 AI 算力:光学、神经形态与生物计算 — ycombinator · 2026-10-02