Amazon 论文:agent 训练秘方能压缩进 16 token,压到 8 就崩
RunAI_Coder · reddit · 2026-09-16
作者解读 Amazon Responsible AI 团队一篇论文,实验设计很有意思:一个 Claude Opus agent(Claude Code 环境)在 ML 任务验证集上爬山搜索数百轮;第二个 agent 读完完整 transcript,把策略压缩成 32 token;第三个全新、无记忆、无验证集访问权的 agent 仅凭这 32 token 加训练数据复现方案。
关键发现:
- WikiText 任务上,30 个非默认超参选择可压到 16 token(如 QKn 12L768 Mu .1 R² b2M 4x 等缩写),压到 8 token 就复现失败;丢失的恰是 batch size、MLP ratio、QK-norm 这些「依赖数据、偏离默认值」的选择——默认部分 fresh agent 自己就能长出来。
- 故意让 agent 过拟合:102 个 checkpoint 中 38 个验证集领先超 10%,压缩成 128 token 交给 fresh agent 后 38 个全部复现失败——写不下来的收益其实存在于验证集里。
作者引申到 agent compaction:同一模型既写摘要又读摘要,天然知道两端的默认值;摘要最先丢的往往是「决策的条件」(如「迁移完成前用 legacy parser」被压成「用 legacy parser」),而条件正是非默认部分。他会把 compaction 笔记写成一类句子:一个干净 checkout 不会做出的选择 + 理由 + 失效日期。局限:论文任务有唯一指标和验证集,coding 没有这类 oracle;且压缩器有四轮审计,现实 summarizer 没有。
「编程与Agent」频道最新
- Codex /goal 原生看板上线:任务卡片随完成自动移动 — TheMoonMidas · 2026-09-16
- Pixio 推出 AE 插件:AI Agent 直接在时间线里搭图层与关键帧 — tsi_org · 2026-09-16
- 用 Nex-N2.5 Pro 造出可交互 3D 机械花园,改 N 轮才成型 — nikola_mr64990 · 2026-09-16
- Grok Build v1.0.33 大更新:MCP 结构化 JSON、记忆管理与长会话可靠性提升 — XFreeze · 2026-09-16
- 12 本塑造工程思维的 DevOps 与 SRE 书单,从凤凰项目到 SRE 圣经 — _jaydeepkarale · 2026-09-16
- 可克隆的「Receipt Desk」:带一手信源验证的 AI 研究台 — tetsuoai · 2026-09-16