Meta hLLM 用匈牙利算法一次解码完整排序,推理提速 64 倍至 28ms

_reachsumit · x · 2026-09-03

Meta 论文 hLLM(Hungarian LLM)针对生成式重排的解码瓶颈提出新方案:排序器只需输出 N 个序数值,天然具有排列结构。hLLM 用轻量自注意力头从 LLM prefill 隐藏状态读出 N×K 的物品-位置分数矩阵,再用匈牙利算法求解最优二分匹配,构造性保证输出合法排列,O(1) 次前向解码全部序数。

配合 LoRA 微调与教师排序蒸馏,端到端推理仅 28ms,相比自回归解码提速 64 倍且排序质量与教师持平。论文提供了架构、训练信号、骨干适配的完整消融,并指出这一思路可推广到其他 O(1) 解码场景,把生成式排序与组合优化连接起来。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →