不改参数,强模型为弱模型搭 Harness 即可让基准准确率近翻倍
青稞AI · wechat · 2026-09-03
青稞AI 介绍论文《AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses》:不更新任何模型参数,让强模型作为 builder,在测试时为弱模型自动构建推理 harness(任务路由、结构化抽取、确定性代码、验证、输出控制等)。
- 仅改变模型外部 harness,GPT 在多个 benchmark 上准确率提升接近翻倍。
- 提升并非靠让弱模型「想更久」,而是把部分推理编译成代码、规则和结构化流程,降低弱模型的认知负担;可被 offload 的推理越多、builder 越强,效果越好。
- 作者提出 AI4AI 视角:能力不一定压缩进权重,也可外化为工具、代码、路由与验证环境。
文末预告 9 月 5 日 UIUC 博士生钱成的线上直播分享,并附社区介绍。
「编程与Agent」频道最新
- 被 Agent 要 API 密钥,敷衍一句它真自己搞定了 — shakoistsLog · 2026-09-21
- Pretty Mermaid 开源:让 AI Agent 本地渲染精美 Mermaid 图,无需浏览器 — tom_doerr · 2026-09-21
- 把税务文件凭证交给 AI 助手:好用但令人不安 — zeeg · 2026-09-21
- 编码 agent AdaL 招募 10 名免费用户,求最狠批评 — Zachly · 2026-09-21
- 开发者自建 Grok Bot「anew」,把 AI 机器人接成免费网页服务 — round · 2026-09-21
- JevArena 开源:盲测对比各模型当 AI 评委的水平与成本 — richie9830 · 2026-09-21