Scale AI 推 CliniCARE-Bench,测医疗 Agent 真实推理

alexandr_wang · x · 2026-08-27

Scale AI 推出 CliniCARE-Bench 基准,旨在测试临床 AI Agent 的实际工作能力。该基准不仅考察医学知识,更评估 Agent 处理纵向记录、协调证据、结论落地及知难而退(abstain)的能力,解决模型“正确理由错误”的问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →