Kimi K2.7 纯 RL 训练逆袭:小模型跑分超 GPT-5.6 与自家 K3

echen · x · 2026-09-17

Surge AI 团队分享仅用强化学习后训练 Kimi K2.7(Max reasoning)的成果:在 1700 个自建编码任务上做 RL 后,模型在五个外部编码基准全部提升。

三个关键发现

涌现行为:一次训练中模型需要写 Zstandard 解压器,但没有 zstd 二进制可验证——它先写了一个压缩器,自己生成合法测试文件,再用这些文件测试解压器。没有 ground truth 就自己造一个。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →