Flow Reasoning 模型:并行决策可修正,数独难题求解率近 100%
burny_tech · x · 2026-09-12
一条关于新型结构化推理架构的推文串,汇总了该方向的并行工作:Flow Reasoning Models(FRMs)与 Diffusion as a Training Curriculum for Timestep-Free Iterative Reasoning。
FRM(arXiv:2606.29150)核心思路:
- 现有架构的困境:自回归模型按顺序生成、无法修正早期决策;掩码扩散模型需要复杂的解码方案来协调相互依赖的预测。
- FRM 将连续 flow 适配到离散结构化输出上,通过「自条件化」让模型以自身过往输出为输入,把一次性去噪变成迭代式的解精炼,可以并行做出并修正决策。
- 为解决递归深度增加时的 exposure bias,提出 Fixed-Point Forcing(FPF):在模型自身推理动力学产生的状态上训练,同时保留标准 flow-matching 目标。
- 成绩:Sudoku-Extreme、Zebra、Maze-Unique 上求解率分别达 99.5%、100.0%、99.9%,Sudoku-Extreme 峰值精度超过所评测的掩码扩散等方法。
作者认为这类方法效用很大,期待后续发展。
「研究」频道最新
- RSI 研究分野:harness 自我改进已实用,「智能爆炸」仍未被证明 — arthurcolle · 2026-09-14
- 亚马逊提出按查询相关性剪枝索引,预算内优化检索 — _reachsumit · 2026-09-14
- 新研究:检索时信号对自适应 RAG 路由并无可靠增益 — _reachsumit · 2026-09-14
- Google 实验:Graph RAG 把 Java 转 Python 的 API 幻觉率从 56% 降到 16% — _reachsumit · 2026-09-14
- 立场论文:推荐系统应从平台排名转向个人 Agent 代理推荐 — _reachsumit · 2026-09-14
- Spotify 论文:Agent 时代推荐系统的受众正从人变成 AI — _reachsumit · 2026-09-14