新论文:LLM 输出多样性远低于训练数据,调温也补不回来
rohanpaul_ai · x · 2026-09-04
论文《Do LLMs Capture the Diversity in their Training Data?》系统比较模型输出与训练数据在同一前缀下的条件多样性,发现:
- 在 OLMo、Pythia、GPT-Neo 上,无论 greedy、nucleus 还是 ancestral 采样,训练数据的条件多样性都显著高于模型输出。OLMo 20K 样本下训练数据得分 338.58,greedy 仅 218.88,nucleus 287.31,ancestral 297.31。
- 更大的模型并未消除这一差距,图像生成器也呈现同样模式。
- 简单调温度不是解法:T≈1.9 才能匹配训练熵,但精度和条件 NLL 明显变差。
- 作者提出的替代方法:生成多个候选后对「合理但被低估」的输出重新加权,无需重训或新增采样即可提升测得的多样性。
结论:LLM 学到的答案分布比训练数据窄得多,这是采样策略之外的结构性现象。
「研究」频道最新
- AI BioDesign 研究加速器成立,联手 UW Medicine 用 AI 设计生物工具 — AllThingsApx · 2026-09-04
- Sarvam AI 开源 Vāgartha:近 22 万条梵文诗句配详解数据集 — selfawareatom · 2026-09-04
- ORNL 用 AI 操控显微镜探针,连续 25 小时逐分子搭建材料 — Scobleizer · 2026-09-04
- OpenAI 研究员:GPT-6 思维链可控性随 RL 训练持续上升 — gleech · 2026-09-04
- 把 SGD 建模为渗流过程:解释训练中方差尖峰与相变行为 — Sai Niranjan Ramachandran · 2026-09-04
- Compile by Training:把自然语言规格编译成可本地部署的神经函数 — UWaterloo · 2026-09-04