模型合并新框架:LLM推荐系统推理链缩短24%
_reachsumit · x · 2026-08-12
该论文提出了一种针对大模型推荐系统的模型合并框架。通过将“慢思考”模型与“快思考”模型在注意力头级别进行细粒度合并,能够在保持预测准确率的同时,将冗长的推理链缩短最多24%,从而有效降低推理成本。
「研究」频道最新
- 为什么 AI 需要“记忆工程”:图谱记忆胜过扁平向量库 — anirbanbandyo · 2026-08-12
- LlamaIndex 推出 ExtractBench:覆盖 8 大领域 4869 页复杂文档 — llama_index · 2026-08-12
- Mitsuhiko等呼吁学术界应多点直接批评少点玻璃心 — cloneofsimo · 2026-08-12
- AI 音乐不必是“电子垃圾”:交互式生成音乐的新趋势 — jordiponsdotme · 2026-08-12
- Decoding-Level Taboo: 大模型推理路径鲁棒性测试 — Tadanobu Chuyo Kamijo · 2026-08-12
- AI记忆评测基准遭质疑:评分指标差异致偏差24% — True_Mongoose_7073 · 2026-08-12