OpenTumorBoard:611 例真实肿瘤会诊轨迹基准,14 个 LLM 表现不佳
Anqi Li · hf · 2026-10-03
基准构成
- 从 YouTube 上 12,534 分钟公开肿瘤多学科会诊录像转录而来,含 611 个患者病例、19,157 轮讨论,覆盖十类专科角色。
评测设置
- SPECIALIST TURN:LLM 回答真实讨论中的临床问题。
- BOARD SIMULATION:模型生成完整多轮讨论,并就治疗方案、手术计划、下一步行动与临床试验匹配达成共识。
结果
- 评测 14 个通用与医疗前沿模型:与专家答案的临床等价性最好仅 3.43/5,与会诊结论的一致性 2.78/5。
- 监督微调与强化学习在保留测试集上有效,说明真实讨论轨迹可用于模型适配。
- 三位 M.D. 专家审核子集,确认病例信息覆盖度与事实性高、共识结论抽取保真度强。
基准与自动化构建管线将开源,用于发展多学科个性化癌症决策 LLM。
「模型」频道最新
- 半年前被Google拒之门外的千元周末跑分消费,如今畅通无阻 — vivekhaldar · 2026-10-03
- Gemini 4 Argon 悄然现身 Gemini API 文档,或下周公开发布 — lyraxana · 2026-10-03
- 云专家体验 OpenAI Dots:从怀疑到真香,但槽点不少 — nickbaumann_ · 2026-10-03
- Claude 在评测中不再作弊?网友列出四种可能解释 — gleech · 2026-10-03
- 谷歌 9 月 AI 汇总:Gemini 4 Argon 与 Googlebook 等密集发布 — GeminiApp · 2026-10-03
- 用户发现 ChatGPT Atlas 的 Dot 能看到已彻底删除的对话内容 — DicmanCocktoasten · 2026-10-03