北大研究:改写高影响力训练样本比重加权更能持久改变模型行为
PKU · hf · 2026-09-10
- 来自北京大学团队的论文《From Reweighting to Rewriting: Unlocking the Intervention Effects of Influential Samples in Training Data Attribution》。
- 核心发现:在训练数据归因(TDA)识别出的高影响力样本上做影响引导的回答改写(influence-guided response rewriting),比传统的重加权(reweighting)干预方式,能在语言模型上产生更强、更持久的行为改变。
- 结论强调「有影响力的数据」具有更广泛的干预杠杆:不止可用于解释模型,还能作为更有效的行为干预手段。
「研究」频道最新
- 加磁性杂质扰动物理系统,简单 ML 即可推断量子磁体哈密顿量 — bravo_abad · 2026-09-10
- 视觉+力觉融合机器人穿衣:12 人 264 次实测,手臂套入率达 85% — stepjamUK · 2026-09-10
- J-lens 解读:窥见并改写 LLM 未说出口的中间概念 — CatAstro_Piyush · 2026-09-10
- Group Bench:约 100 道群论题测你的 AI agent — Sauers_ · 2026-09-10
- Group Bench 发布:约 100 道群论题考验 AI 智能体 — Sauers_ · 2026-09-10
- ELLIS 博士项目开放 2026 申请,10 月底截止 — ArthurGretton · 2026-09-10