多次采样再投票,可能是提升推理的强力无标注方法

iatitov · x · 2026-07-21

这条转述了一项关于 LLM 推理改进的方法观点:多次采样多个解,再取多数答案,可能是无需人工标注也很可靠的提升方式。

核心意思是:很多现有训练方法都会把“多样化的共识”压缩成一个过滤器、偏好信号或单一奖励值;作者提出也许应该把这种共识结构直接保留下来,让模型去“读”这些结果。

配图展示的流程是:

整体是在讨论一种更直接利用多答案共识的训练/蒸馏思路。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →