Sharon Li 演讲:逐轮量化 AI 智能体进展与失败诊断
SharonYixuanLi · x · 2026-10-10
威斯康星大学 Sharon Yixuan Li 在 Simons Institute 演讲,主题是:AI 智能体日益自主,但我们的监控与诊断能力跟不上。她介绍了三篇 NeurIPS'26 论文,从细粒度的逐轮(turn-by-turn)层面量化智能体进展并定位失败:
- Tracing Agentic Failure from the Flow of Success:从成功轨迹的流动中追踪智能体失败来源。
- Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents:提出「进展优势(Progress Advantage)」,利用后训练中未被挖掘的免费信号衡量 agent 进展。
- Hide-and-Seek in Trajectories:发现 VLA(视觉-语言-动作)模型运行时监控的失败信号。
演讲视频已放出。
「编程与Agent」频道最新
- 「流氓 Agent 应按 APT 追踪」:安全研究者呼应纳德拉表态 — nitarshan · 2026-10-11
- 开源自托管 agent 工作区 Open Dots 获 5.6k 星,对标多家商业 agent — matchaman11 · 2026-10-11
- 十个月从骂到真香:开发者新游戏全靠 vibe coding 完成 — DeryaTR_ · 2026-10-11
- 圈内饭局爆料:前沿实验室都在跑"递归自我改进"循环 — Hesamation · 2026-10-11
- Garry Tan 公开 agent 协同工作流:单线程调度合并队列,只有全绿 CI 才进主干 — garrytan · 2026-10-11
- Plane Agents 上线两周 token 消耗惊人,团队自曝被用量数据震撼 — JosephJacks_ · 2026-10-11