26M专用检测器胜过微调27B VLM,手术器械识别缩放几乎无效

A Comparative Study in Surgical AI: Potential and Limitations of Data, Compute, and Scaling

Kirill Skobelev, Eric Fithian, Yegor Baranovski, Jack Cook, Sandeep Angara, Shauna Otto, Zhuang-Fang Yi, John Zhu, Neeraj Mainkar, Margaux Masson-Forsythe, Daniel A. Donoho, X. Y. Han

cs.AI, cs.CV, cs.LG

2026-03-29

芝加哥布斯与SDSC在8个手术数据集上评测:20个开源VLM零样本几乎不过多数类基线;26M YOLO精确匹配54.73%,超过微调后的Gemma 3 27B。

这篇在解决什么

主流医疗评测套件几乎不测术中视觉。MedQA、MedGemma、OmniMedVQA 一类榜单覆盖问答、影像、病理,但手术视频里「这帧有哪些器械」这种最基础的感知经常缺席。手术要同时处理画面、协作和物理操作,通才模型如果能做,会是很有吸引力的助手。手术标注要专业、训练要算力,缩放能不能把这件事做起来并不清楚。

芝加哥布斯应用 AI 中心与 Surgical Data Science Collective(SDSC)把神经内镜经鼻入路(EEA)里的器械识别当成压力测试:非专家标注员稍加训练就能标到接近满分。通才模型如果连这关都过不了,谈术中协作还早。

方法

私有主数据集 SDSC-EEA 来自美国、法国、西班牙 7 家机构 10 位外科医生捐赠的 66 台手术,67,634 帧、31 类器械。训练和验证按手术台切开(53 台 / 13 台,47,618 / 20,016 帧),同一台手术不会漏进两边。平均每帧 1.72 把工具,吸引器出现在 63.3% 的帧里。标注由无临床经验的外包完成,再经资深标注员和 SDSC 复核,不到 10% 的帧需要改正。

实验分七组:20 个开源视觉语言模型(VLM)零样本,规模从 2B 到 235B,覆盖 2023 到 2026;对 Gemma 3 27B 做 LoRA 微调,一种学输出 JSON 工具列表,一种换成 31 维多标签分类头;LoRA rank 从 2 扫到 1024,可训练参数差近三个数量级;26M 参数的专用检测器 YOLOv12-m;三个公开集复现,胆囊切除 CholecT50(6 类)、垂体内镜 PitVis-2023(18 类)、猪组织达芬奇训练 SurgVU(17 类),并加上 GPT、Claude、Gemini、Kimi、Qwen 共 11 个闭源前沿模型;四项不需要框的任务(流程、缝合手势、动作、解剖是否在画面里),对照 ResNet-50 小专家、手术基础模型 LemonFM 的线性探针、以及 LoRA 微调的 Gemma。

精确匹配要求整帧工具集合完全一致,多一个少一个都不算。公开集没有逐帧框,YOLO 训练时用合成全图框,实质上是 YOLO 骨架上的多标签分类器。

结果

零样本这边几乎全部掉在基线附近。SDSC-EEA 验证集多数类基线是 13.41%,20 个开源模型里只有 Qwen3-VL-235B 以 14.52% 勉强超过;Gemma 4 31B 的 MMBench 在这批里最高(90.9),工具检测只有 10.05%。医学特化的 MedGemma 3 27B(6.36%)还不如同骨架的 Gemma 3 27B(9.83%)。解析失败不是主因:大模型格式错误率已经低于 1%。

微调能抬起来,但抬不满。JSON 头精确匹配 47.63%,分类头 51.08%,Jaccard 61.33%。按手术台切开之后,验证集里几乎没见过的工具会直接归零:吸引器-微刨削器验证集有 497 例,召回仍是 0%。LoRA rank 扫到 1024(3 个 epoch),训练集精确匹配从 35.9% 涨到 98.6%,验证集仍低于 40%。容量够拟合,过不了台次分布偏移。

26M 的 YOLOv12-m 精确匹配 54.73%、Jaccard 64.00%、top-1 70.06%,用大约千分之一的参数超过最好的 VLM。只用集合标签、不用框的 ResNet-50 也能到 39.6%,已经压过全部零样本 VLM。

公开集上同一套故事:

数据集多数类基线零样本 Gemma 3 27B微调 GemmaYOLOv12-m最强前沿零样本
CholecT5034.76%6.87%83.02%81.37%Gemini 3.8 Flash 73.40%
PitVis-202339.63%28.46%84.77%82.78%Claude Fable 5.1 58.70%
SurgVU16.94%2.90%50.61%51.75%Claude Sonnet 4.6 23.05%

SurgVU 上 11 个前沿模型只有 5 个明确超过 16.94% 基线,最强的还落后微调开源模型和 YOLO 约 28 个百分点。不需要框的四项任务里,25.6M 的 ResNet-50 或 LoRA 分类头拿下每一组第一:流程识别 micro-F1 77.1%,手势 53.0%,解剖 71.6%,动作识别则是 LoRA 分类头的 78.8%。LemonFM 线性探针次之。10 个前沿模型全部排在前两名之后;手势识别上只有 Claude Fable 5.1 过了多数类基线。

为什么重要

这是一篇对「把通才模型直接送进手术室」泼冷水的测量学论文,不是又一个新架构。主流医学榜单测不到术中感知,MMBench 高分也转不过来。私有数据不能送给第三方 API,所以 SDSC-EEA 上没有闭源数字;公开集上闭源确实比开源零样本强,但仍然显著落后任务特化训练。

对要做手术 AI 的团队,更实际的路径是小专家做感知、通才做调度。把 27B 视觉语言模型当检测器用,性价比不对。跨院汇集并标注手术视频,比再堆参数更像瓶颈。

局限与存疑

全部评测都是单帧,模型看不到时间上下文,更没有决策支持或异常检测。闭源模型在较大验证集上只用了 1000 帧子样本。SurgVU 的标签来自机械臂安装/卸载事件,记录的是「这段时间臂上装着这把工具」,不是「裁切后的这一帧画面里看不看得见」,会压低只能看图的零样本分数。三个公开检测集上 YOLO 没有真框监督。论文也承认,再大的模型和更长的训练仍可能出现非线性跃迁,当前实验排除不了。

EEA 的 31 类长尾和按台次切分,让 SDSC-EEA 比只有 6 类的 CholecT50 难得多:胆囊数据集上验证准确率能跟着 rank 涨到 85.1%,EEA 上 3 个 epoch 就卡在 40% 以下。结论对难分布成立,对类少、分布匀的公开集要打折扣。

术语

原文与代码

社区讨论

相关论文

全部论文解读