多 harness 强化学习兴起,Kimi、DeepSeek 等混用训练

zainhas · x · 2026-10-11

开发者 zainhas 指出,在多套 harness(评测/推理框架)上做强化学习,正在让「选对单一 harness」这件事变得过时。据其说法,Kimi K3、MiniMax M3、DeepSeek V4.1、Mimo v2.6 等模型都是在多种 harness 组合下训练的,模型对 harness 的依赖被大幅削弱。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →