多 harness 强化学习兴起,Kimi、DeepSeek 等混用训练
zainhas · x · 2026-10-11
开发者 zainhas 指出,在多套 harness(评测/推理框架)上做强化学习,正在让「选对单一 harness」这件事变得过时。据其说法,Kimi K3、MiniMax M3、DeepSeek V4.1、Mimo v2.6 等模型都是在多种 harness 组合下训练的,模型对 harness 的依赖被大幅削弱。
「模型」频道最新
- Google EmbeddingGemma 2 免费本地跑,Mac 即可体验 — Saboo_Shubham_ · 2026-10-11
- 用户吐槽 Google AI Mode 搜索仍会幻觉,称一年多未见 AI 翻车 — burny_tech · 2026-10-11
- 跑个任务 Claude 直接烧掉 17 美元,用户直呼钱包顶不住 — lxfater · 2026-10-11
- 自费用户的 AI 算账法:单任务成本才是唯一值得关注的指标 — victor_explore · 2026-10-11
- 数学家逐条核查:OpenAI 的 Navier-Stokes 证明在 Lean 中无误 — burny_tech · 2026-10-11
- 阿里披露 Qwen 已连续跑 RSI 一个多月,Qwen 4.0 全系深度自进化 — teortaxesTex · 2026-10-11