HuggingFace 用多编码工具强化训练开放权重模型
HuggingFace 研究人员提出 multi-harness 强化学习方法,CEO Clément Delangue 宣布将 Claude Code、Codex、Hermes、Pi、opencode 等共 10 个主流编码 harness 直接变为 RL 训练环境,解决开放权重模型在更换 agent harness 后性能掉点、产出无效工具调用的问题,让模型在不同工具环境中保持稳定表现。
2026-10-05 ~ 2026-10-05 · 2 条相关
- Hugging Face 把 Claude Code、Codex 等 10 个编码工具变成 RL 训练环境 — huggingface · 2026-10-05
- HuggingFace 用多 harness 强化学习解决模型换壳掉点问题 — huggingface · 2026-10-05