实验性奖励模型筛选出 Gemma SFT 输出中的糟糕样本

kalomaze · x · 2026-08-21

作者正在构建实验性的奖励模型,并在 Gemma SFT(监督微调)的输出样本中搜索评分最低的“最差”样本。这个过程在尾部定位到了一些极其糟糕的生成结果(作者戏称为“immaculate gemeralds”)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →