强模型给弱模型搭脚手架:不训练小模型,准确率近乎翻倍
机器之心 · wechat · 2026-08-30
Salesforce AI 与 UIUC 的研究提出 Strong-to-Weak Scaffolding:让强模型(Builder)在仅开放 5% 验证集的条件下,为弱模型(Target)自动设计 Harness——分类路由、Python 求解器、显式状态追踪、格式检查等外部结构,全程不改弱模型参数。
实验以 GPT-5.4-mini 为 Target,裸跑平均准确率 0.488,自动 Harness 加持后平均 0.763、最佳 0.912,57 次构建全部超过基线,甚至超过裸跑的更强模型 GPT-5.4(0.619)。论文将这种迁移的本质称为「认知负担降低」:被迁移的不是知识,而是强模型对任务结构的理解——外部代码承担的工作比例与准确率强相关(r=0.72)。研究还发现并非所有思考都能编译成规则(BigToM 约 94% 可固化,MuMA-ToM 仅 36%),且 Target 越弱、提升空间越大;Builder 的优势来自推理强度而非反复试错。这预示 AI 评测将从「裸模型能力」转向「模型+环境」的系统能力。
「编程与Agent」频道最新
- Claude Code 等 Agent 进化神速,演示震撼远超文字描述 — tinyfool · 2026-08-30
- 律师用 Cursor 自建 AI 高管团队,3 小时内容流程压到 10 分钟 — Specialist_Call_1257 · 2026-08-30
- 机器人项目实战:Claude 编码彻底失效,基础架构成最大障碍 — verdakorz · 2026-08-30
- Perplexity 本地优先智能体:Qwen3.8 27B 跑出近零成本知识工作 — 机器之心 · 2026-08-30
- 11 年前手写 JS 婚礼请柬,如今 AI 一次生成安卓动态壁纸 — steren · 2026-08-30
- 全栈开源体验:Qwen+Hermes 打造可自我修改的电脑 — ramagetime · 2026-08-30