OPUS 在优化器空间选数,并构建 3000 万 token 代理池
VoidAsuka · x · 2026-07-25
这条讲的是 ICML 论文 OPUS:作者认为现有动态数据选择大多在“原始梯度空间”里打分,隐含假设是 SGD,但真实训练并不一定是 SGD;因此他们把优化器的预条件子引入打分过程,让选择发生在 AdamW、Muon 等优化器真正走过的几何空间中。
帖子还提到一个关键细节 BENCH-PROXY:不直接拿 benchmark 验证集当目标方向,而是先把 benchmark 做 embedding,再从预训练语料中检索相似文档,构成一个 3000 万 token 的代理池。这样做的目的,是避免原始 benchmark 数据过于分布外导致梯度目标噪声过大,让选择信号更稳定。
「研究」频道最新
- Hamel Husain:Opus 5 成本高 6 倍却跑输评测 — HamelHusain · 2026-07-25
- 字节与莫纳什论文把任务经验蒸馏进软件代理权重 — imjustnewatai · 2026-07-25
- Snorkel AI 认为 Agent 评测该从生产 trace 重建 — AI Engineer · 2026-07-25
- 统计物理论文研究插值附近的 MLP 最优学习 — burny_tech · 2026-07-25
- ICML 论文称正则化让学习更像 Hebbian,噪声则相反 — burny_tech · 2026-07-25
- AI 自主完成 9000 行数学证明,攻克复杂流体力学方程 — burny_tech · 2026-07-25