Inkling-Small 模型更新:连续强化学习大幅提升编码能力

LiTianleli · x · 2026-07-31

Inkling-Small 最初通过从主模型 Inkling 的同策略蒸馏进行训练,其初始表现已经能与原版相媲美。随后,团队针对编码和智能体能力进行了为期两周的连续强化学习(RL)训练。

作者表示,这种持续的训练策略产出了一个更为强大的最终模型,并感叹“RL goes brrrrr!”(强化学习一路狂飙)。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →