多次采样再投票,可能是提升推理的强力无标注方法
iatitov · x · 2026-07-21
这条转述了一项关于 LLM 推理改进的方法观点:多次采样多个解,再取多数答案,可能是无需人工标注也很可靠的提升方式。
核心意思是:很多现有训练方法都会把“多样化的共识”压缩成一个过滤器、偏好信号或单一奖励值;作者提出也许应该把这种共识结构直接保留下来,让模型去“读”这些结果。
配图展示的流程是:
- 采样多个 rollout
- 形成 consensus
- 构造 teacher
- 再 distill 到 student
整体是在讨论一种更直接利用多答案共识的训练/蒸馏思路。
「研究」频道最新
- LFM2 扩容 tokenizer 后,泰语 token 减少 4 倍 — maximelabonne · 2026-07-21
- Argus 用协同可见性与几何 Transformer 提升室内 3D 重建 — ducha_aiki · 2026-07-21
- WAIC 机器人正进入可商业化成功率阶段 — chris_j_paxton · 2026-07-21
- Unitree 用自家 G1 集群上线真实机器人远程评测 — chris_j_paxton · 2026-07-21
- 给 VLM 加顺序元数据后,错误检测会崩掉 — m_wulfmeier · 2026-07-21
- 新提示模板提升空间推理,并减少模型偷懒输出 — legit_api · 2026-07-21