长时程 Agent 技术入门:METR 时长倍增与工程挑战
agihouse_org · x · 2026-08-21
长时程 Agent 的技术入门
文章回顾了前沿模型自主任务时长的演进:2022 年模型只能独立完成相当于人类数秒的工作,如今领先的 agent 已能持续完成人类需要数小时的任务,且按 METR 的测量,这一「时长」翻倍所需的时间间隔本身还在缩短。
Sequoia 2026 年 1 月的文章《2026: This is AGI》(Pat Grady 与 Sonya Huang)提炼了其中的商业意义:一个能在整个工作日里保持目标的 agent,就是一个可以被「雇佣」的 agent——编码 agent 是第一个实例,垂直领域专家是模板。
在测量与论点之间是一个工程问题:要让它真正可靠地在数小时自主工作中持续达成目标,需要在模型、基础设施和评估层面做什么。这正是本文要展开的主题。
所属事件:长时程 Agent 技术演进:从秒级任务迈向数小时自主(3 条相关)→
「漫话AGI」频道最新
- Owain Evans 做客 80,000 Hours 谈 AI 对齐 — OwainEvans_UK · 2026-08-22
- 新文观点:LLM 证明 Unix 哲学胜利,文本至上 — Pseudomanifold · 2026-08-22
- LLM 证明了 Unix 哲学的胜利 — Pseudomanifold · 2026-08-22
- AI 共识误导团队:一致性降低好奇与准确性 — DrKavner · 2026-08-22
- 微软高管:AI 是选择性系统,更快更优者胜出 — dfinke · 2026-08-22
- 反AI阵营叙事能力过强,不仅仅是技术问题 — wordgrammer · 2026-08-22