Anthropic 花 300 万美元做了 30 个月真实企业 Agent 评估
2C_ornot2C · x · 2026-07-25
- Anthropic 据称花了 300 万美元、用 30 个月时间,在真实公司里的真实任务上评估 AI agent,覆盖 1287 个任务、240 万行代码。
- 这条转述强调的结论是:真正拉开差距的不是“会不会提词”,而是系统设计、记忆机制和多轮循环。
- 配图里的文章主张用 Loop Engineering 做评测:先聚类 traces,再自己做标注工具,让 AI 实时监控标注过程,动态调整抽样和接受/拒绝策略。
- 另一张论文图则展示了面向 agent 工作流的 graph engineering 评估,强调在生产级任务上能带来明显的效率和质量收益。
「编程与Agent」频道最新
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11
- 实测找 105 个隐藏 bug:DeepSeek V4.1 Flash 得 24 分,成本仅 Opus 5 的 3.5% — ChartsJournalX · 2026-09-11
- 投资分析师求教:如何用 Claude 搭建尽调 Agent 工作台 — Careless_Tie2286 · 2026-09-11
- 把 Agent 当失忆症患者:三层上下文分层法让对话不再从零开始 — evielync · 2026-09-11
- Android 手机跑 Firefox MCP:Termux+ngrok 完整教程 — Nervous-Strain7544 · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11