OPUS 在优化器空间选数,并构建 3000 万 token 代理池

VoidAsuka · x · 2026-07-25

这条讲的是 ICML 论文 OPUS:作者认为现有动态数据选择大多在“原始梯度空间”里打分,隐含假设是 SGD,但真实训练并不一定是 SGD;因此他们把优化器的预条件子引入打分过程,让选择发生在 AdamW、Muon 等优化器真正走过的几何空间中。

帖子还提到一个关键细节 BENCH-PROXY:不直接拿 benchmark 验证集当目标方向,而是先把 benchmark 做 embedding,再从预训练语料中检索相似文档,构成一个 3000 万 token 的代理池。这样做的目的,是避免原始 benchmark 数据过于分布外导致梯度目标噪声过大,让选择信号更稳定。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →