XM 用 best-of-K 训练提升保真度,逼近数据分布
anshulkundaje · x · 2026-08-04
这条长转发是在解释 XM 论文 的方法:模型一次生成多个候选,然后用其中 loss 最小的那个 来训练,从而让模型更像是在“搜索”数据分布,而不是像标准 MSE 那样更容易收敛到均值。
作者认为,这种目标函数能带来更高保真度,也可能让训练更快;而且推理阶段几乎没有额外成本,因为“多候选”主要发生在训练时。帖子还补充说,best-of-K 并不是全新想法,但 XM 把它推进到了更一般、更有用的形式。
「研究」频道最新
- 论文指出所谓“全错”MATH 数据集漏掉了大量正确答案 — burny_tech · 2026-08-04
- 宾州州立大学报告探讨社会科学如何帮助 AI 理解道德判断 — soumitrashukla9 · 2026-08-04
- NeurIPS AC:审稿人要 rebuttal,却常忽视澄清请求 — prajdabre · 2026-08-04
- 研究者让人形机器人从自己的错误中继续学习 — imjustnewatai · 2026-08-04
- Qwen 3.8 Max 在高难度 INDUCTION 基准拿到 42% 排名第二 — DeryaTR_ · 2026-08-04
- 新 Hugging Face 工作台记录完整模型图、轨迹与可复现实验 — guzdial · 2026-08-04