top-p 采样尾部退化:模型每步都锁死首选词导致循环
ziv_ravid · x · 2026-09-28
解释长文循环的成因:每一步都可以检查所选词在模型排名中的位置。正常写作会从少数几个好选项中挑选,而 top-p 采样在文本尾部会让模型每次都选排名第 1 的词,这正是循环的定义;自适应采样器则不会陷入这种状态。
所属事件:研究称长文循环元凶是采样器而非模型本身(3 条相关)→
「研究」频道最新
- d9bench:测试决策模型掷九面骰的概率是否均匀 — swishfever · 2026-09-28
- 研究:LLM 仅凭目录等结构化元数据即可重建文档全文 — ChuckDBrooks · 2026-09-28
- 新表征方法显著提升 NetHack 与 Craftax 强化学习成绩 — GlenBerseth · 2026-09-28
- 记忆历史不等于推理历史:agent 记忆系统缺失「因果溯源」层 — puppy_lover_2021 · 2026-09-28
- 前 CMU 学者呼吁:复杂系统科学家应深度参与 AI 对齐研究 — joshua_saxe · 2026-09-28
- NVIDIA Nemotron 系列技术报告解读:训练日益 Agent 化 — cwolferesearch · 2026-09-28