Dataset Policy Gradients: researchers embed a QR code in GPT-2's weights using only training data

ChengleiSi · x · 2026-10-07

A new COLM paper introduces Dataset Policy Gradients, a method to precisely optimize synthetic training data against any differentiable training or post-training metric.

Original post →

More from Research

Research channel →