HiSME 让 LLM Agent 连“学技能的方法”也能继续进化
机器之心 · wechat · 2026-07-23
清华大学与华为基础模型部研究者提出 HiSME,一种面向大模型 Agent 的轻量级“技能元演化”框架。
核心思路
- Agent 先把执行轨迹总结成可复用的 skills。
- HiSME 进一步演化的不只是 skill 本身,还包括产生和维护 skill 的流程。
- 全过程停留在文本空间,不更新模型参数。
工作机制
- Extractor 从单条轨迹中提取候选技能。
- Refactorer 从多条轨迹或已有技能中抽象共享结构。
- Refiner / filter 根据有效性与复用性修订、禁用或保留技能。
- Metarefiner 把反馈总结成 meta-skills,再写回技能抽取与维护的提示词中。
实验结果
- 在 BFCL-v3 多轮工具调用 和 MineDojo 上验证。
- 效果优于无技能基线、静态技能演化方法,以及 AWM、Memento 等测试时学习基线。
- 在 MineDojo 这类长程任务中,更好的技能能减少无效探索和 token 开销。
- 冻结下来的元技能还能迁移到新的静态运行中,说明它们本身也有质量。
意义
这篇论文把 Agent 优化的对象从“模型参数”扩展到“提示词、工具路由、记忆、评测器和技能维护策略”等外部 harness。
「编程与Agent」频道最新
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11