Amazon 论文:agent 训练秘方能压缩进 16 token,压到 8 就崩

RunAI_Coder · reddit · 2026-09-16

作者解读 Amazon Responsible AI 团队一篇论文,实验设计很有意思:一个 Claude Opus agent(Claude Code 环境)在 ML 任务验证集上爬山搜索数百轮;第二个 agent 读完完整 transcript,把策略压缩成 32 token;第三个全新、无记忆、无验证集访问权的 agent 仅凭这 32 token 加训练数据复现方案。

关键发现:

作者引申到 agent compaction:同一模型既写摘要又读摘要,天然知道两端的默认值;摘要最先丢的往往是「决策的条件」(如「迁移完成前用 legacy parser」被压成「用 legacy parser」),而条件正是非默认部分。他会把 compaction 笔记写成一类句子:一个干净 checkout 不会做出的选择 + 理由 + 失效日期。局限:论文任务有唯一指标和验证集,coding 没有这类 oracle;且压缩器有四轮审计,现实 summarizer 没有。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →