模型合并新框架:LLM推荐系统推理链缩短24%

_reachsumit · x · 2026-08-12

该论文提出了一种针对大模型推荐系统的模型合并框架。通过将“慢思考”模型与“快思考”模型在注意力头级别进行细粒度合并,能够在保持预测准确率的同时,将冗长的推理链缩短最多24%,从而有效降低推理成本。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →