SFT 只遮响应是元凶:全序列掩码解锁扩散模型 prompt infilling
kastnerkyle · x · 2026-09-24
Patronus AI 的论文被 COLM 2026「非自回归语言模型」workshop 接收,研究 masked diffusion 语言模型(如 LLaDA、Dream)为何无法从期望输出反推 prompt。
- 问题根源:这类模型虽是双向架构,但开箱不支持 prompt infilling。作者追溯到训练惯例——SFT 阶段只对响应做掩码,prompt 从未被遮。
- 修复方法:改为全序列掩码(prompt 和响应同时遮),仅这一处改动就让模型能从 few-shot 示例中推断出任务适配的 prompt。
- 效果:模型自动 infill 的 prompt 优于或媲美人工模板,可跨模型迁移,且与现有 prompt 优化方法互补。
- 结论:瓶颈在训练实践而非架构本身。作者呼吁社区在发布标准 checkpoint 的同时,一并发布全序列掩码 SFT 版本。
「研究」频道最新
- π0.5 真机微调实测:数据多样性胜过纯堆量,成功率冲到 98% — DominiqueCAPaul · 2026-09-24
- π0.5 制造任务实战:1 小时干净数据胜过此前 17 小时 — DominiqueCAPaul · 2026-09-24
- Claude 首个成果出炉:Anthropic 揭秘新分子生物学实验室运作模式 — AnthropicAI · 2026-09-24
- Anthropic:Claude 在噬菌体 DNA 中发现未知酶系统,结构神似 CRISPR — AnthropicAI · 2026-09-24
- 医疗AI模型xvr登Nature:数秒完成X光与CT/MRI配准 — DrDatta_AIIMS · 2026-09-24
- OpenRSI 发布 v0.1:用千卡集群和 60 小时 agent 轨迹评测递归自我改进 — RulinShao · 2026-09-24