Meta 与 UW 新论文:让 Agent 自由编辑上下文,多赚 11.4% 准确率省 21.5% 算力
alex_verem · x · 2026-10-05
华盛顿大学与 Meta 团队发布 Context Language Models(CLM)论文:把模型的实时上下文当作一个文件,让模型自己全权决定保留、删除或移到磁盘,而不是依赖工程师手写的摘要/裁剪规则或固定动作菜单。
关键结果:
- 深度研究基准 BrowseComp-Plus 上 59.4%,比最强人类设计方法高 11.4%,FLOPs 少 21.5%;
- 12 小时编码任务上比 Codex 式摘要高 5%,算力省 59%;
- 24 小时六 agent 协同优化六个代码仓库的任务,同样开销下加速提升多 65%;
- 在四个数学优化问题上胜过专门的演化系统。
模型自己发明了技巧:建独立「笔记」区、写清理函数并复用 37 次、用实时记分板追踪 helper agent、把工作记忆维持在 6-8K tokens。团队还用在线强化学习训练 Qwen3.5-9B,使其在研究基准上从 28.8% 升至 42.5%,代码已在 GitHub 开源。
作者同时警示一个风险:模型可重写自身记忆时,prompt injection 可藏入其中并在多轮间存活。
所属事件:Meta 与 UW 提出上下文语言模型:让 LLM 自主编辑自身上下文(4 条相关)→
「编程与Agent」频道最新
- Karpathy 谈读懂数学模型输出:用 ASD-STE100 与图表让 LLM 更易读 — dair_ai · 2026-10-05
- 开发者把编码 Agent 界面改造成 iMessage 风格,称生活更美好了 — davidfromkansas · 2026-10-05
- Reddit 网友用游戏本+iPhone+Tailscale 搭起本地 AI Agent 网络 — Due_Recording_5802 · 2026-10-05
- 单工具全过却整链失败:实测揭示 MCP 测试必须跑完整工作流 — Stock-Pumpkin-8859 · 2026-10-05
- 网友点子:AI agent 别只演示订机票,试试报税和记账这些真活 — vivekhaldar · 2026-10-05
- 亚马逊 2B、Cloudflare 9B/27B 开源决策模型挑战 Jev — mark_k · 2026-10-05