针对扩散语言模型评测难题,团队提出基于样本的距离指标 SOL
LucaAmb · x · 2026-10-08
针对近期关于扩散语言模型(diffusion LM)难以评测的讨论,Greg Kornhardt 团队不直接沿用传统评测方式,而是提出 SOL——一种基于样本的方法,用来度量生成文本分布与真实文本分布之间的距离,并以长推文形式展开介绍。该指标旨在绕开逐样本打分的困难,从分布层面评估扩散 LM 的生成质量。
「研究」频道最新
- Aaronson 长文「数学末日」:OpenAI 372 项成果包括唯一博弈猜想证明 — burny_tech · 2026-10-08
- OpenAI 发布内部前沿模型产出的系列数学新成果 — itsOmSarraf_ · 2026-10-08
- 训练别人写的 Agent:如何驾驭非自建 harness 的强化学习 — SergioPaniego · 2026-10-08
- 研究者指控 AI 实验室夸大:520 个证明无一有 Lean 形式化 — gerardsans · 2026-10-08
- 第三方检测器复测 NeurIPS 论文 AI 检测:两工具结果分歧明显 — AltruisticCouple3491 · 2026-10-08
- 烧掉 3000 亿 token 毫无突破,内部模型 3 小时破局 — burny_tech · 2026-10-08