DiPOD 扩散语言模型后训练法:一行代码让数独准确率 22% 升 97%
berkeley_ai · x · 2026-10-10
- COLM 会议 Non-Autoregressive Language Models 工作坊上,Haozhe Jiang 展示了 Berkeley AI 团队的新工作 DiPOD(Diffusion Policy Optimization without Drifting Apart)。
- 核心观点:扩散语言模型目前不够聪明的主要瓶颈是缺乏稳定的后训练方法,DiPOD 被称为扩散模型后训练的「三脚架」。
- 在推理任务上全面提分,最亮眼的是数独准确率从 22% 跃升至 97%,且只需一行代码改动即可实现。
- 报告时间 15:25–15:40,地点 Union Square 22 四层。
「研究」频道最新
- 2D 协同进化通信迁移到实体机器人:30 次实验仅 1 次成功 — uv-mex · 2026-10-10
- 协同进化通信 2D→3D 迁移:短回合评估会低估控制器性能 — uv-mex · 2026-10-10
- SGS 只改 RL 重置采样,机器人零真实数据组装齿轮成功率94% — abhishekunique7 · 2026-10-10
- 35.5万矩形装箱数据库刷新15项方块装箱纪录,几乎零算力 — ctjlewis · 2026-10-10
- AI 评估员研究怎么做:五步方法论与实战经验总结 — davidstutz92 · 2026-10-10
- Regents Labs 推出每日一篇 AI 论文精读栏目 Paper Pro Daily — seanwbren · 2026-10-10