Inkling-Small 模型更新:连续强化学习大幅提升编码能力
LiTianleli · x · 2026-07-31
Inkling-Small 最初通过从主模型 Inkling 的同策略蒸馏进行训练,其初始表现已经能与原版相媲美。随后,团队针对编码和智能体能力进行了为期两周的连续强化学习(RL)训练。
作者表示,这种持续的训练策略产出了一个更为强大的最终模型,并感叹“RL goes brrrrr!”(强化学习一路狂飙)。
「模型」频道最新
- 实测绕过 Pangram v4 AI 检测:短句诗歌更易蒙混过关 — ctjlewis · 2026-07-31
- 学者激辩 Scaling Law:模型变强但泛化变差? — davidmanheim · 2026-07-31
- Neutrino-8B 上榜 HF,采用低于 2-bit 的三值量化 — FermionResearch · 2026-07-31
- Kwaipilot KAT-Coder-V2.5 登顶 HF 热门,主打智能体编程 — bartowski · 2026-07-31
- True Positive Weekly 第171期:AI经济、SynthID水印与Kimi K3 — burkov · 2026-07-31
- 模型翻车名场面:DeepSeek对话中坚称自己是Claude — FluidEngine369 · 2026-07-31