Flow Reasoning Models:把流模型改造成循环推理器,数独解决率达99.5%
alec_helbling · x · 2026-09-17
研究者提出 Flow Reasoning Models(FRM),一种面向结构化推理的新框架:将连续流(flow)应用于离散结构化输出,再通过 self-conditioning 让模型把自己的预测反复喂回输入、迭代修正错误。
核心思路
- 自回归模型按顺序提交决策、无法回头修改;掩码扩散模型则需要精细的解码方案来协调相互依赖的预测。FRM 让模型并行做出并修正相互依赖的决策。
- 通过把一次性去噪变成循环解法精炼,运行循环更久即可扩展测试时算力;每轮有独立的局部损失,无需沿时间反向传播。
- 针对 self-conditioning 在深层循环下的 exposure bias,提出 Fixed-Point Forcing(FPF):在模型自身推理动力学产生的状态上训练,同时保留标准 flow-matching 目标。
成绩
在 Sudoku-Extreme、Zebra、Maze-Unique 三个基准上分别达到 99.5%、100.0%、99.9% 的解决率;在 Sudoku-Extreme 上峰值准确率超过所评测的掩码扩散等方法。论文:arXiv 2606.29150(IBM/Georgia Tech 等机构合作)。
所属事件:Flow Reasoning Models 让流模型学会循环推理(3 条相关)→
「研究」频道最新
- Google DeepMind Dream-RSI论文:把研究过程本身变成可自我改进的对象 — McDonaghMatthew · 2026-09-17
- Google DeepMind等发布Dream-RSI,实验记录可复用助力递归自我改进 — McDonaghMatthew · 2026-09-17
- MIT 机器人船群水上自组装搭桥,登 Nature — lukas_m_ziegler · 2026-09-17
- DeepMind 开源果蝇全身仿真,59 维动作空间可在笔记本上飞 — anthara_ai · 2026-09-17
- 小鹏发布 XPACE 具身世界模型,IRON 机器人用未来模拟学恢复 — CyberRobooo · 2026-09-17
- 新型稀疏模型附赠廉价归因方法:max-pooling 可把输出映射回输入词 — antoine_chaffin · 2026-09-17