企业该拥有业务知识而不是模型,前沿 agent 能力每 6—7 个月翻倍
hamostaf04 · x · 2026-07-26
这篇文章的核心观点是:企业真正该“拥有”的不是模型,而是 业务知识。
- 文中引用 METR 软件任务基准指出,前沿 agent 在 50% 可靠度下可完成的任务长度大约每 6–7 个月翻倍一次,模型能力在快速跃迁。
- Stanford AI Index 也显示,达到 GPT-3.5 级别性能的查询成本在约 18 个月里下降了 280 倍以上。
- 作者认为,企业护城河不在于自建一个模型,而在于把“公司怎么运转”沉淀成知识资产:哪些异常案例要怎么判、哪些规则会因客户/州别/场景变化。
- 建议的方法是:记录工作与结果、收集纠错和边界案例、把经验转成示例/规则/检查项,再迁移到下一代模型上持续累积。
- 文中用理赔审核举例:专家对边界案例的人工改判,最终应变成可复用的规则和质量检查,而不是停留在一次性决策里。
「公司和人」频道最新
- Anthropic 员工称入职 6 个月“非常棒”并放出招聘链接 — EricBuess · 2026-07-26
- OpenAI 签署开放权重公开信,模型规模化服务更难了 — steipete · 2026-07-26
- Sonnet 5 连续数周自治跑仓库,修构建、提 issue、读 README — Sauers_ · 2026-07-26
- 团队会跑评测,却未必知道新版本是否真的更好 — hwchase17 · 2026-07-26
- Pupper Build Day 把新手、学生和 Unitree 人形机器人聚到了一起 — DynamicWebPaige · 2026-07-26
- 本地 AI 生态把助手竞争推向行动入口 — TheTuringPost · 2026-07-26