微软上交大开源 Argus:让 Agent 连续自主研究数天的运行时
机器之心 · wechat · 2026-09-07
微软与上海交通大学等机构开源 Argus,一套面向长周期研究任务的通用 Agent 推理运行时,并发布技术报告(arXiv:2608.05144)。
核心主张:从 Goal-Driven 到 Evidence-Driven
现有 Agent 自动化了「执行」(Harness),但执行之上的「驾驶」仍靠人。Argus 把这个位置称为 Driver:下一步由已有证据而非初始目标决定,避免目标僵化,Driver 持续回答四问——工作是否完成且够好、下一步最值得做什么、经验如何改变系统行为、剩余问题是否需人类决策。
架构设计
- 长期项目组织为持久化 Campaign,拆成边界明确的 Mission。
- 闭环为 Manager→Planner→Engineer⇄Reviewer→Manager:多角色各自持有独立上下文、共享工作区,避免单个 agent 局部爬山并提高 token 效率。
- 支持混用 Pi、Codex、Claude Code、DeepSeek Harness 等不同 harness。
- 通过证据门槛的经验才进入 Wiki 与 Skill,按 Project/Vertical/Global 作用域复用;Core 与垂域解耦,由领域专家定义各领域何为有效证据。
实测成果
报告覆盖 27 个 Campaign、1,548 小时墙钟时间,平均每 40.7 小时请求一次人类干预,工作占空比 95.1%–98.7%。开源不到一个月已在 AI4System、AI4Science、芯片设计、AI4Math、AI4AI 等方向交付成果,并首个公开端到端数学猜想解决筛选日志与全部运行轨迹。
「编程与Agent」频道最新
- AI agent 跑 12 小时实验,自主开发出一款格斗游戏 — msg · 2026-09-07
- vibe coding 新玩法:快速试烂点子再扔掉,腾出脑子想新点子 — generativist · 2026-09-07
- 通勤路上用手机连本地 Mac 模型写码,他卡在这四件事上 — former_farmer · 2026-09-07
- 5 分钟读懂「Prompt Debt」:提示词正在变成技术债 — dbreunig · 2026-09-07
- 开发者自称已有「贾维斯」:agent 回复看都不看了 — BLUECOW009 · 2026-09-07
- 爆料:今年 2 月 OpenAI 研究员每天在编码 agent 上花 0 美元 — zacharynado · 2026-09-07