利用投机解码的废弃 logits 进行在线强化学习训练

ycombinator · x · 2026-08-12

推文探讨了如何利用大模型推理栈中的「废弃」数据来优化模型。在投机解码过程中,目标模型会对被拒绝的 token 计算 logits,这些数据通常被丢弃,但实际上它们是现成的、符合当前真实流量分布的在线训练信号。

作者指出,由于草稿模型通常在通用数据集上训练,与实际应用场景(如语音助手、编程智能体等)的特定分布不匹配,会导致接受率随时间下降,从而显著降低吞吐量。通过回收这些被丢弃的 logits 进行在线训练,可以有效解决分布偏移问题,维持推理加速效果。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →