XM 用 best-of-K 训练提升保真度,逼近数据分布

anshulkundaje · x · 2026-08-04

这条长转发是在解释 XM 论文 的方法:模型一次生成多个候选,然后用其中 loss 最小的那个 来训练,从而让模型更像是在“搜索”数据分布,而不是像标准 MSE 那样更容易收敛到均值。

作者认为,这种目标函数能带来更高保真度,也可能让训练更快;而且推理阶段几乎没有额外成本,因为“多候选”主要发生在训练时。帖子还补充说,best-of-K 并不是全新想法,但 XM 把它推进到了更一般、更有用的形式。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →