Anthropic 花 300 万美元做了 30 个月真实企业 Agent 评估
2C_ornot2C · x · 2026-07-25
- Anthropic 据称花了 300 万美元、用 30 个月时间,在真实公司里的真实任务上评估 AI agent,覆盖 1287 个任务、240 万行代码。
- 这条转述强调的结论是:真正拉开差距的不是“会不会提词”,而是系统设计、记忆机制和多轮循环。
- 配图里的文章主张用 Loop Engineering 做评测:先聚类 traces,再自己做标注工具,让 AI 实时监控标注过程,动态调整抽样和接受/拒绝策略。
- 另一张论文图则展示了面向 agent 工作流的 graph engineering 评估,强调在生产级任务上能带来明显的效率和质量收益。
「编程与Agent」频道最新
- Devin 接入 Claude Opus 5,FrontierCode 1.1 逼近 Fable 5 且成本减半 — _sholtodouglas · 2026-07-25
- ChatGPT Work agent 现在能登录网站并保留会话 — OpenAIDevs · 2026-07-25
- Codex 多智能体编排:Scout、Worker、Coordinator 分工协作 — pvncher · 2026-07-25
- 内部 CS Research Agent 已接入 GPT-5.6 与 Claude 模型 — BenBajarin · 2026-07-25
- LiteParse 2.8.0 去掉 ImageMagick,转 PDF 最快提速 7.2 倍 — llama_index · 2026-07-25
- Claude Opus 5 在 1/3 和 2/5 之间反复改答案 — Sauers_ · 2026-07-25