外科智能榜单更新:20余款通用 VLM 全面落后专科模型
ddonoho · x · 2026-09-15
SDSC × UChicago 团队更新了「外科智能排行榜」,在 10 个手术相关数据集上对比当前主流视觉语言模型,覆盖器械识别、解剖结构、手术技能评估、上下文 VQA 和操作建议五类任务。
核心发现:
- 所有通用 VLM 都显著低于专科模型天花板。以专科模型为 1.0 计,最强的 GPT-6 Astra 仅 0.566,Qwen3.8 Max 0.423,Gemini 系列在 0.37-0.40 区间,Claude/Grok/Kimi 多在 0.1-0.35 之间,部分小模型甚至为负分(接近随机)。
- 微调的小模型 LemonFM(linear probe)达 0.863,远超所有通用大模型,接近专科水平。
- 榜单按模态细分,各模型差异明显:如技能评估类几乎全员接近 0,而推荐类任务普遍表现较好。
结论:外科视频理解这类专科任务上,通用 VLM 与领域专科模型之间仍有巨大差距。
「模型」频道最新
- Resemble AI 发布 DETECT-World:物理推断式深伪检测,音频准确率 99.5% — AiBreakfast · 2026-09-15
- Grok 4.7 再次跳票,2.5T 参数 Grok 4.8 本周完成训练 — eyishazyer · 2026-09-15
- Reddit 用户痛诉 Gemini Flash 3.8 长上下文严重退化:多轮叙事像失忆 — Quenty1 · 2026-09-15
- Ai2 主席预测:美国前沿大厂 18 个月内将连训练数据全开源 — billhilf · 2026-09-15
- 外科基准不像数学基准:微调小模型为何能登顶专科任务 — ddonoho · 2026-09-15
- Claude Opus 5.2 疑似灰度测试,跳过 5.1 直接上线 Claude Code — Angaisb_ · 2026-09-15