Nature 论文把病理医生浏览行为变成 AI agent 训练数据
yuyinzhou_cs · x · 2026-07-25
这篇发表在 Nature Biomedical Engineering 的论文提出了 Pathology-CoT:把病理专家在全切片图像(whole-slide image)上的真实浏览行为,转化为可扩展的 AI agent 监督信号。
核心方法
- 系统会记录病理医生在标准切片查看器里的导航过程。
- 再把原始交互日志整理成标准化的行为指令和框选信息。
- 这样就能同时学到两类监督:“看哪里” 和 “为什么这里重要”。
研究动机
- 全切片病理诊断本质上是一个交互式、多步骤任务,不只是静态分类。
- 但现有 agent 往往缺少专家在实践中形成的“隐性浏览策略”,这是重要瓶颈。
结果
- 研究团队据此构建了一个两阶段 agent Pathology-o3:先找出感兴趣区域,再做行为引导的推理。
- 在胃肠道淋巴结转移检测任务上,它超过了当前最先进的 vision-language 模型。
- 这种提升在多个 VLM backbone 上都能复现,并且在独立外部验证队列上也保持稳定。
结论
这项工作说明,医学 AI 不一定只需要更多文字标注;专家的交互轨迹本身也可以成为训练 agent 的高价值监督数据。
「研究」频道最新
- 多个模型都出现了意外明显的“幽灵”自我特征 — voooooogel · 2026-07-25
- LLM 能写量子论文后,作者署名该怎么做 — MvsCerezo · 2026-07-25
- AI海量数学证明涌现,验证难引发学术界担忧 — littmath · 2026-07-25
- 中文房间论证重回大模型“理解”争论中心 — Roger_M_Taylor · 2026-07-25
- 北大等推出 Jetson-PI:端侧 VLA 控制频率提升 8.6 倍至 6Hz — 机器之心 · 2026-07-25
- Surya Ganguli:理解 AI,物理学可能比定理证明更有用 — SuryaGanguli · 2026-07-25