亚马逊AGI实验室:80%可靠性的Agent为何还不够用
AI Engineer · youtube · 2026-10-09
亚马逊 AGI Lab 的 Felipe Blanes 在 AI Engineer World's Fair 2026 上分享了服务 Nova Act(亚马逊浏览器智能体服务)客户的经验。
核心问题「基准幻觉」:静态评测分数很高,但真实客户会做没人预料到的事,agent 就崩了,剩下只能靠祈祷。
解法:客户驱动的评测飞轮(四步):
- 按客户的方式定义「成功」,而不是按 benchmark
- 捕获真实信号,包括直接和客户聊
- 诊断差距出在模型、工具还是产品层
- 把发现喂回决策,让评测每周都变聪明
关键洞察:
- 信任悬崖:80% 可靠性让用户觉得「用你还不如自己干」,约 92% 才开始感觉可信赖
- 坦诚公开系统限制,比更高的跑分更能建立信任
- Amazon Leo、Hertz、Sola 的客户用出了意想不到的场景
- 保持评测新鲜的四原则
「编程与Agent」频道最新
- Salesforce 提出 SRD 蒸馏后见之明,2B 模型成功率从 0 到 60.6% — Salesforce · 2026-10-09
- 实测 AI Agent 网站准入难:16 个 subreddit 已封 7 个 — lulzxdxdxd · 2026-10-09
- Prompt tuning 被集体遗忘,微调 token 或被严重低估 — cephaloform · 2026-10-09
- 架构师分享:用 WhatsApp 语音搭建个人 AI 管家 — No_Kangaroo_4454 · 2026-10-09
- AI 工作台密集上新:多人协作、交互仪表盘、记忆与技能 — heyneighbor · 2026-10-09
- 换 harness 不换模型,GPT-5.6 仓库迁移成绩从 6.5% 飙到 31% — omarsar0 · 2026-10-09