Dataset Policy Gradients:仅靠训练数据就能在 GPT-2 权重里嵌入二维码

ChengleiSi · x · 2026-10-07

Tristan Thrush 等人在 COLM 发表新论文 Dataset Policy Gradients:一种精确优化合成训练数据的方法,可以针对任意可微分的训练或后训练指标定向优化。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →