多项研究揭示 Agent 技能检索的双刃剑效应
多篇论文聚焦 agent 技能机制的有效性边界。《Demystifying Agent Skills》通过 8135 次跨基准实验揭示技能何时有效何时失效;另有 EMNLP 论文发现 17 个 LLM 在接入技能检索后反而在原任务上变差,并提出新指标 RAE 衡量检索被真正调用时的实际效果;对比实验还显示将历史轨迹蒸馏为 SKILL.md 比保留执行细节的工作流记忆高出 6.06 个百分点,说明技能生效靠稳定执行而非经验堆积。
2026-09-08 ~ 2026-09-08 · 4 条相关
- 研究:蒸馏 SKILL.md 比工作流记忆高 6.06 分,技能靠稳定执行起效 — rohanpaul_ai · 2026-09-08
- arXiv 论文解密 Agent Skills:8135 次实验揭示技能何时有效何时失效 — rohanpaul_ai · 2026-09-08
- 论文揭示 agent 技能检索评测陷阱:整体变好,检索任务反而变差 — rohanpaul_ai · 2026-09-08
- EMNLP 论文:17 个 LLM 检索技能后反而在原任务上变差 — rohanpaul_ai · 2026-09-08