谷歌论文:蒸馏掉专用 harness,任务成功率从 23.3% 升至 44.3%
omarsar0 · x · 2026-09-24
谷歌及其合作者发布新论文,研究 agent harness 能否被蒸馏进模型本身。
- 移除专用 harness 后,宏观任务成功率反而从 23.3% 升至 44.3%,甚至超过基础模型挂载 harness 时的 41.7%。
- 方法 Harness-Zero:仅在训练阶段使用优化过的 harness。由于优化 harness 与部署 harness 动作空间不同,一个 harnessing agent 会先把学生在部署动作空间里的响应修正后再执行,这些修正后的轨迹成为训练示范。
- 在知识工作、工具使用和科学领域的 28 项 harness 诱导行为上,平均可恢复 82.3%。
- 对使用同一进化 harness 的前沿模型,agent-as-harness 形式也优于 code-as-harness 形式。
作者指出该方法的鲁棒性仍待验证,但方向相当有趣。
「编程与Agent」频道最新
- NoSpoon Agent 全自主写微短剧:30 分钟跑完一集,日产 400 部系列 — Kyrannio · 2026-09-24
- 研究:智能体记忆可伪造权限,未授权请求失真率高达 50.2% — rohanpaul_ai · 2026-09-24
- 27B 本地模型够用后他停掉了 API:Qwen 编码实测与成本账 — Training-Respect8066 · 2026-09-24
- 网友设想用语音 Agent 接骚扰电话,专门浪费骗子时间 — djcows · 2026-09-24
- Matt Pocock 为 AI 编码词典收录热词 Software Factory — mattpocockuk · 2026-09-24
- GPT-6 更新后工作流翻车,重度用户考虑转投 Claude 订阅 — WhiteBoyWhoJumps · 2026-09-24