强模型给弱模型搭脚手架:不训练小模型,准确率近乎翻倍

机器之心 · wechat · 2026-08-30

Salesforce AI 与 UIUC 的研究提出 Strong-to-Weak Scaffolding:让强模型(Builder)在仅开放 5% 验证集的条件下,为弱模型(Target)自动设计 Harness——分类路由、Python 求解器、显式状态追踪、格式检查等外部结构,全程不改弱模型参数。

实验以 GPT-5.4-mini 为 Target,裸跑平均准确率 0.488,自动 Harness 加持后平均 0.763、最佳 0.912,57 次构建全部超过基线,甚至超过裸跑的更强模型 GPT-5.4(0.619)。论文将这种迁移的本质称为「认知负担降低」:被迁移的不是知识,而是强模型对任务结构的理解——外部代码承担的工作比例与准确率强相关(r=0.72)。研究还发现并非所有思考都能编译成规则(BigToM 约 94% 可固化,MuMA-ToM 仅 36%),且 Target 越弱、提升空间越大;Builder 的优势来自推理强度而非反复试错。这预示 AI 评测将从「裸模型能力」转向「模型+环境」的系统能力。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →