研究揭示掩码扩散语言模型何时需要动态调整解码策略,仅调 10% 状态获 56.9% 收益
HOLILAB · hf · 2026-10-01
HOLILAB 发布论文《Unmask the State》,研究掩码扩散语言模型(MDM)推理时的 unmasking 策略自适应问题。
核心框架:
- 将 MDM 推理组织为五个轴:score、cardinality、region、commitment、planning,定义"自适应机会"为最佳候选动作相对固定策略的单步效用优势。
- 通过"策略反转"(strategy reversals)刻画:何时某个替代动作会优于固定选择。
关键发现:
- 在 3 个 MDM 和 10 个任务上,自适应机会高度异质,部分状态下存在集中且可预测的单步收益。
- 提出选择性自适应:用验证集校准的轻量检测器识别高机会状态。在 LLaDA-8B 受约束 JSON 填充任务上,仅调整 10% 的状态即可捕获 56.9% 的候选集 oracle 收益。
结论:状态自适应应选择性应用而非均匀应用。
「研究」频道最新
- KLS 猜想部分攻克:arXiv 论文核心思路由 AI 生成 — burny_tech · 2026-10-01
- 牛顿法求解开普勒方程:好、坏与丑的三种结局 — burny_tech · 2026-10-01
- 从临床风险预测到核聚变控制:同一套生存分析数学的跨界之旅 — nagpalchirag · 2026-10-01
- 用 AlphaFold 解释「同构映射」:AI 为何能破解蛋白质折叠难题 — contrascript · 2026-10-01
- 学界提议用「挑战赛+共享评测」取代灌水会议论文 — micoolcho · 2026-10-01
- 分层差分注意力提升医学 ViT 鉴别诊断能力 — PTenigma · 2026-10-01