Meta-Skill:让固定权重模型学会为智能体搭更好执行环境
apodex · hf · 2026-10-01
研究 test-time AI-for-AI:权重不变的 Builder 模型学习为 Target 模型构建更好的执行环境(harness)。核心是 Meta-Skill——从 Target 在开发集上的执行反馈中提炼'何时需要支持、提供什么资源'的原则,存入冻结技能库供未见任务复用。
在 Harness-Bench 与 NewtonBench 上,全库 meta-skill 构建比无技能构建平均提升 8.95 个百分点,比直接把技能库交给 Target 高 12.02 个百分点。同一模型兼任双角色时仍有增益,提示系统级自我改进的可能路径:学会搭建更好的环境。
「编程与Agent」频道最新
- 不用 Fable 纯跑 Opus 4.5,不到两天烧完 Claude 周额度 — yihui_indie · 2026-10-01
- 双模型分工实操:Opus 管架构审查,Sol 负责大量编码 — haider1 · 2026-10-01
- 形式化验证专家批 AI 圈认知落后 15 年:现代 FV 不靠 SMT 与翻译器 — tianyin_xu · 2026-10-01
- a16z 工程合伙人:用 Codex 控管多账号 DM 和收件箱,完胜邮件 API — ericjang11 · 2026-10-01
- 为何 Agentic 推理需要 P/D 分离:30 万行代码库场景下的延迟拆解 — abhijithneil · 2026-10-01
- Meta RankEvolve:多 Agent 互查把自动研究执行准确率提至 62.5% — _reachsumit · 2026-10-01