Dataset Policy Gradients:仅靠训练数据就能在 GPT-2 权重里嵌入二维码
ChengleiSi · x · 2026-10-07
Tristan Thrush 等人在 COLM 发表新论文 Dataset Policy Gradients:一种精确优化合成训练数据的方法,可以针对任意可微分的训练或后训练指标定向优化。
- 核心思路是把「训练数据的选择」当成可优化对象,用策略梯度方法直接优化数据集,使其满足目标指标
- 展示性实验:仅通过操纵训练数据,就在 GPT-2 的权重中嵌入了一个可扫描的 QR 码,演示了对模型内部表征的精确控制
- 论文宣称既能用于实用的数据优化,也能做出这类「离谱」的定向控制,作者正在 COLM 现场展示海报
「研究」频道最新
- CollabSkill 研究亮相 COLM 2026,斯坦福团队参与 — dan_fried · 2026-10-07
- COLM 论文:潜空间推理模型的潜 token 多数可解码,可解释性即正确性信号 — sarahwiegreffe · 2026-10-07
- Apple ML 招聘研究实习生:让基础模型「知道自己知道什么」 — sineadwilliamso · 2026-10-07
- CAVEAT 测试台登场:商店促销能否带偏你的 AI 购物 Agent — ZacharyHuang12 · 2026-10-07
- GEA:以群体为进化单元的 Agent 自我改进范式,SWE-bench 71% — xwang_lk · 2026-10-07
- 9B 模型花 25 美元算力微调,达 Jev 决策指数 79% 分数 — sophiamyang · 2026-10-07