统一白盒 RL harness 可切换 Kimi Code 等多种框架
stochasticchasm · x · 2026-07-28
- 这条讨论的是一个统一的白盒 RL 环境:把 agent harness 拆成可配置、可组合的模块,包括工具接口、system prompt、上下文管理、skills、memory、subagents 等。
- 通过配置化重组,这个环境可以实例化 Kimi Code、Claude Code、Codex、OpenClaw、Hermes 等现有 harness,也能支持全新的 harness。
- 核心观点是:只用单一固定 harness 做训练,容易让模型过拟合某种工具协议;而可配置环境能让 RL 暴露在更多 harness 组合里,提升训练出的 agent 的泛化性。
「编程与Agent」频道最新
- UWaterloo 开源可审计的实时训练控制平面 — UWaterloo · 2026-07-28
- 研究发现 BIRD 与 Spider 2.0-Snow 标注错误率超五成 — ddkang · 2026-07-28
- Text-to-SQL 基准审计采用 SAR-Agent 与专家复核 — ddkang · 2026-07-28
- 团队找出同一系统提示词的四个副本,线上还在用第五份 — larabyeol · 2026-07-28
- Kimi K3 登陆 Together AI,主打编码智能体推理接入 — togethercompute · 2026-07-28
- Agent Mission Control 用桌面面板可视化 Copilot CLI 会话 — DanWahlin · 2026-07-28