模型权重不动,Harness 自进化:Terminal-Bench 成绩 47.57 升至 52.43
jiqizhixin · x · 2026-10-02
IQuest Research、北航与曼彻斯特大学提出 ModularRSI,探索「Harness 层递归自改进」(Harness RSI):基座模型全程冻结,仅让包裹模型的运行时机制——提示、工具使用、记忆、协调等——随 agent 执行经验不断自我修改。
核心结论:在完全不动模型权重的情况下,仅靠 Harness 进化就使 Terminal-Bench 2.0 成绩从 47.57 提升到 52.43。这提示当模型本身不再变化时,改进模型的「使用方式」仍能持续带来能力增长。
「编程与Agent」频道最新
- 先访谈 5 问再写码:滚动网页生成的结构化 Prompt 模板 — aziz4ai · 2026-10-02
- 一条提示词工作流:用 Claude 生成 GSAP 滚动动画单文件网页 — aziz4ai · 2026-10-02
- 让agent改代码后怎么办?求客户定制代码的维护部署方案 — Embarrassed-Survey61 · 2026-10-02
- Cloudflare 推出 AI Gateway Web Search API,统一接入三家搜索商 — michellechen · 2026-10-02
- 20任务×3重复=120次运行:harness对比评测的隐形成本 — RelationshipRound711 · 2026-10-02
- 蚂蚁内部Tiger Agent曝光:Ling-3.1-flash跨浏览器终端规划办公工作流 — tinkerbellyie · 2026-10-02